NVIDIA 联合微软发布 RTX Spark 与 DGX Station for Windows
NVIDIA 与微软在 Windows AI 活动中宣布合作,推出 RTX Spark 与 DGX Station for Windows。
推荐理由:NVIDIA 联合微软发布 RTX Spark 与 DGX Station for Windows,将本地 AI 算力推向消费级笔记本与企业桌面,为 Agent 持续运行提供硬件基础。
英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力市场的风向。
NVIDIA 与微软在 Windows AI 活动中宣布合作,推出 RTX Spark 与 DGX Station for Windows。
推荐理由:NVIDIA 联合微软发布 RTX Spark 与 DGX Station for Windows,将本地 AI 算力推向消费级笔记本与企业桌面,为 Agent 持续运行提供硬件基础。
Hugging Face 发布 Nemotron 系列模型在 IOI 2026 和 IMO 2026 竞赛中获金牌的成绩。Nemotron-3-Ultra-CC 在 IOI 中得分 535.4/600,IMO 系统得分 30/42。官方开源了相关模型权重、训练数据集、推理代码及 NeMo-Skills 工具包。
推荐理由:原文给出了 Nemotron 在 IOI 和 IMO 的金牌成绩及微调方法,读者可据此复现顶尖编程与数学推理能力。
NVIDIA DGX Spark 推出 64GB 统一内存配置,由 Acer、ASUS 等厂商提供,起售价 4999 美元。该配置支持在本地运行百亿参数模型,并可通过 NVIDIA Sync Cluster Assistant 将两台设备集群,实现 128GB 内存池化与 1.7 倍性能提升。
推荐理由:提供了64GB配置及双机集群方案,开发者可据此评估本地运行百亿参数模型与智能体的硬件门槛。
OpenAI 推出 GPT-6 Astra Ultrafast 模式,在 NVIDIA Blackwell GPU 上通过推理优化实现比标准模式快 8 倍的 token 生成速度。该模式已开放 API 访问,旨在缩短编码 Agent 的编辑测试循环及工具调用响应时间。
推荐理由:GPT-6 Astra Ultrafast 模式提供 8 倍加速,直接优化了 Agent 编码与工具调用的响应延迟。
NVIDIA联合Google DeepMind等机构,通过AlphaFold Database开源2800多种病毒蛋白复合物3D结构。该数据集利用NVIDIA BioNeMo Inference Runtime优化AlphaFold2生成,包含约30%全新相互作用结构,并同步开源BioNeMo Structure Prediction Pipeline供研究人员预测自身目标。
推荐理由:NVIDIA联合多方开源2800多种病毒蛋白复结构,提供GPU加速预测工具,为未来疫情应对储备关键数据。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,引入支持 AI 智能体的工作流与技能包,并加速 FoundationPose 推理达 5.5 倍。该版本新增对 ROS Lyrical 和 Ubuntu 24.04 的支持,并兼容从 Jetson Orin Nano 到 Jetson Thor 的多种边缘计算平台。
推荐理由:引入AI智能体工作流与FoundationPose推理加速,为开发者提供构建和部署高性能机器人应用的新路径。
NVIDIA 在 Hugging Face 开源 Magpie 多语言 TTS 模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,支持12种语言。该模型提供364M参数开源权重及NIM部署方案,在B200上单流首音频延迟低至32ms,并引入帧堆叠与局部Transformer架构优化推理速度。
推荐理由:提供开源权重与NIM部署方案,支持12种语言及低延迟指标,适合需要私有化部署和定制语音的开发者。
NVIDIA 发布 Cosmos-H-Dreams,一个用于手术机器人的实时动作条件生成式模拟器。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果学生模型,并通过 FlashDreams 加速推理引擎,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 fps 的交互速度。
推荐理由:NVIDIA 发布 Cosmos-H-Dreams 实时手术模拟器,通过蒸馏和 FlashDreams 引擎实现单卡交互推理,为具身智能提供闭环训练环境。
Hugging Face Diffusers原生集成Nunchaku Lite,支持4-bit权重与激活量化(W4A4),无需自定义Pipeline即可加载预量化模型。实测在Blackwell GPU上峰值显存降低约50%,推理速度提升约30%,配合torch.compile可提速至1.8倍。
推荐理由:Nunchaku Lite原生集成至Diffusers,实现4-bit权重与激活量化,显著降低显存占用并提升推理速度。
Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。
推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。
NVIDIA 发布 NeMo AutoModel,基于 HuggingFace Transformers v5 提供专家并行、DeepEP 融合通信和 TransformerEngine 内核。在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B-A3B 上,训练吞吐量提升 3.4-3.7 倍,GPU 显存降低 29-32%,并支持 550B 模型全量微调。
推荐理由:NeMo AutoModel 在保持 Transformers v5 API 兼容的前提下,通过专家并行和内核优化显著提升 MoE 微调性能。
NVIDIA 发布 Nemotron 3.5 内容安全模型,基于 Gemma 3 4B 微调,支持文本与图像的多模态联合评估及 12 种语言。该模型新增自定义企业策略执行与可审计推理(THINK Mode),并开源了包含真实图像的多模态安全数据集。
推荐理由:Nemotron 3.5 将多模态、多语言与自定义企业策略执行整合于单一模型,提供可审计推理与开源数据集。
NVIDIA 在 Hugging Face 开源 Nemotron 3 Nano Omni 多模态理解模型,原生支持文档、图像、视频和音频的联合推理及智能体操作。该模型基于 Nemotron 3 混合 Mamba-Transformer 架构,在文档理解、视频分析和语音交互等基准测试中表现领先,并提供 BF16、FP8 和 NVFP4 权重下载。
推荐理由:NVIDIA 开源 Nemotron 3 Nano Omni 模型,原生支持图文音视频多模态理解与智能体操作,在多项基准上表现领先。
NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。
推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。