跳到正文

#产品更新

今日 2 条
7月27日周一
  1. Hugging Face Blog77

    NVIDIA 发布 Cosmos-H-Dreams 实时手术生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一个用于手术机器人的实时动作条件生成式模拟器。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果学生模型,并通过 FlashDreams 加速推理引擎,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 fps 的交互速度。

    推荐理由:NVIDIA 发布 Cosmos-H-Dreams 实时手术模拟器,通过蒸馏和 FlashDreams 引擎实现单卡交互推理,为具身智能提供闭环训练环境。

7月23日周四
  1. Hugging Face Blog76

    Diffusers原生支持Nunchaku Lite 4-bit扩散推理

    Hugging Face Diffusers原生集成Nunchaku Lite,支持4-bit权重与激活量化(W4A4),无需自定义Pipeline即可加载预量化模型。实测在Blackwell GPU上峰值显存降低约50%,推理速度提升约30%,配合torch.compile可提速至1.8倍。

    推荐理由:Nunchaku Lite原生集成至Diffusers,实现4-bit权重与激活量化,显著降低显存占用并提升推理速度。

7月21日周二
  1. Hugging Face Blog72

    Pollen Robotics 发布 Grabette 开源机器人操作数据采集系统

    Pollen Robotics 发布 Grabette,一套低成本开源手持抓取器及配套软件,用于低成本、低门槛地记录机器人操作演示数据。Grabette 包含双摄像头和 IMU,配合 Gripette 机械臂末端执行器,可将人类手部操作转化为标准的 LeRobot 格式数据集并上传至 Hugging Face Hub,旨在通过社区协作解决机器人学习中的数据瓶颈。

    推荐理由:开源低成本手持抓取器及配套软件,降低机器人操作数据采集门槛,推动开放数据集建设。

7月17日周五
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Flash Cyber 安全模型

    Google 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调的轻量级网络安全模型,旨在快速发现、验证和修复漏洞。该模型通过 CodeMender 向政府和受信任合作伙伴有限开放,在内部基准测试中表现优于主版本 Flash 模型。

    推荐理由:模型针对代码安全微调,在内部基准中超越主版本,通过CodeMender限流发布,为安全团队提供低成本高效方案。

7月15日周三
  1. Hugging Face Blog86

    Thinking Machines 开源 Inkling 1T参数多模态大模型及 Inkling-Small

    Thinking Machines 在 Hugging Face 开源 Inkling 1T参数多模态大模型及 Inkling-Small(276B/12B),原生支持图像、文本和音频输入,具备1M上下文窗口与智能体能力。模型提供BF16与NVFP4量化版本,支持SGLang、vLLM等推理引擎,并附带多项基准测试与部署配置。

    推荐理由:提供了1T参数多模态模型及276B小模型的架构细节、量化部署方案与基准测试,便于评估其推理与多模态能力。

7月8日周三
  1. Mistral AI70

    Mistral发布Robostral Navigate具身导航模型

    Mistral发布Robostral Navigate,这是一款8B参数的具身导航模型,仅使用单RGB相机即可自主导航,在R2R-CE未见环境基准上达到76.6%成功率,超越多传感器方案。该模型完全在模拟数据中训练,结合了指点式导航与在线强化学习,支持轮式、足式和飞行机器人。

    推荐理由:Mistral发布首个具身导航模型,仅用单RGB相机即超越多传感器方案,展示了紧凑模型在机器人领域的落地潜力。

  2. Hugging Face Blog63

    Hugging Face 与 Amazon SageMaker AI 实现一键深度集成

    Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页点击按钮直接进入 SageMaker Studio 进行微调或部署。新环境自动预配置权限,并支持在实例选择时直接查看 GPU 配额。

    推荐理由:一键打通模型发现与部署流程,省去手动配置权限和环境的繁琐步骤。

7月7日周二
  1. Hugging Face Blog70

    微软 Foundry 平台上线 Hugging Face 托管计算服务

    微软在 Build 2026 宣布推出 Foundry Managed Compute,将 Hugging Face 生态中的精选开源模型纳入企业级托管服务。该服务提供一键部署、自动运行时升级与安全扫描,支持 vLLM 等多种推理引擎,并统一了认证、监控与计费接口。

    推荐理由:微软将 Hugging Face 模型纳入企业级托管服务,提供开箱即用的安全与运维能力,降低了开源模型的生产部署门槛。

  2. Hugging Face Blog82

    LeRobot v0.6.0 发布:引入世界模型策略与统一奖励模型API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA 和 FastWAM 等世界模型策略,以及 Robometer 和 TOPReward 统一奖励模型 API。新增 GR00T N1.7、MolmoAct2 等模型支持,集成六个仿真基准测试,并优化了数据加载、FSDP 训练及 HF Jobs 云训练功能。

    推荐理由:本次更新引入了世界模型策略、统一奖励模型API及多项部署训练优化,为机器人学习闭环提供了更完整的工具链。

  3. Hugging Face Blog78

    Hugging Face 与 SkyPilot 联合推出零出口流量存储方案

    Hugging Face 与 SkyPilot 联合推出 `store: hf` 功能,允许在任意云或本地集群上直接挂载 Hugging Face Hub 上的模型和数据集,读取数据不产生出口流量费用。该方案基于 Xet 存储实现增量去重,支持懒加载和断点续传,显著降低了跨云训练和推理的存储与传输成本。

    推荐理由:通过零出口流量存储和跨云调度,解决了模型数据与算力分离带来的高昂跨云传输成本。

7月6日周一
  1. Hugging Face Blog68

    Hugging Face Kernels 重大更新:引入可信发布与代码签名

    Hugging Face 对 Kernels 项目进行重大更新,在 Hub 上引入 kernel 专属仓库类型,默认启用可信发布者机制并支持代码签名以增强安全性。项目新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,并重构 CLI 以更好地支持智能体开发工作流。

    推荐理由:Hugging Face重构了Kernels项目,引入可信发布与代码签名机制,并新增对Torch Stable ABI和TVM FFI的支持。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 发布实时语音 AI 演示

    Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。

    推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。

  2. Google Research65

    Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集

    Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集,并上线 Heat Resilience Earth Engine App。该数据集基于 Sentinel-2 与高分辨率卫星影像融合生成,精度达30厘米,旨在帮助城市规划者识别低反射率建筑并实施降温干预。

    推荐理由:原文提供了覆盖50+城市的建筑级屋顶反射率数据集及可视化应用,为城市热岛缓解规划提供了高精度数据支持。

  3. Google DeepMind81

    Google 发布 Nano Banana 2 Lite 图像模型与 Gemini Omni Flash 视频模型

    Google 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。Nano Banana 2 Lite 主打极速低成本图像生成,4 秒出图,价格 0.034 美元/千张,可无缝替代旧版 Nano Banana。

    推荐理由:Nano Banana 2 Lite 提供极速低成本的图像生成,Gemini Omni Flash 开放视频生成与对话编辑,两者结合可构建端到端的多媒体工作流。

6月30日周二
  1. Google Research77

    Google 发布 TabFM 表格数据零样本基础模型

    Google 发布 TabFM,一个专为表格数据设计的零样本基础模型,通过上下文学习消除手动特征工程和超参数调优。该模型在 BigQuery 中原生集成,支持通过 SQL 直接进行回归和分类预测,并在 TabArena 基准测试中表现优异。

    推荐理由:TabFM 将表格预测重构为上下文学习问题,无需微调即可在 BigQuery 中直接运行,大幅简化了传统机器学习工作流。

6月27日周六
6月25日周四
  1. Hugging Face Blog75

    NVIDIA NeMo AutoModel 发布,基于 Transformers v5 加速 MoE 微调

    NVIDIA 发布 NeMo AutoModel,基于 HuggingFace Transformers v5 提供专家并行、DeepEP 融合通信和 TransformerEngine 内核。在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B-A3B 上,训练吞吐量提升 3.4-3.7 倍,GPU 显存降低 29-32%,并支持 550B 模型全量微调。

    推荐理由:NeMo AutoModel 在保持 Transformers v5 API 兼容的前提下,通过专家并行和内核优化显著提升 MoE 微调性能。

6月24日周三
  1. Mistral AI61

    Mistral Studio 推出连接器企业级控制与调试功能

    Mistral Studio 发布连接器多项企业级功能,包括按工作区或组织控制工具访问权限、支持范围限定的 API 密钥以及多账号连接器。新增的连接器调试器可针对 MCP 连接进行端到端根因分析,连接器功能现已集成至 Workflows 和 Vibe Code 中。

    推荐理由:提供了按工作区控制工具权限、API密钥范围限定及多账号连接等企业级安全功能,便于评估其对自动化工作流的管控能力。

  2. Hugging Face Blog67

    Hugging Face 联合 Treble 推出 FFASR 远场语音识别基准

    Hugging Face 联合 Treble 推出首个开源远场语音识别(FFASR)基准,覆盖 14 种模拟房间与多信噪比条件。评测显示远场低信噪比下的字错误率显著高于近场,并提供准确率与推理速度的权衡分析。

    推荐理由:首次公开远场语音识别基准,提供仿真与实测对照,直观展示真实声学环境下的性能差距。

6月22日周一
  1. Hugging Face Blog68

    PP-OCRv6 发布:支持50种语言的轻量级OCR模型

    PaddleOCR 发布 PP-OCRv6 模型家族,包含 1.5M 至 34.5M 参数的三档模型,支持 50 种语言。medium 版本检测 Hmean 达 86.2%,较 v5 提升 4.6 个百分点,提供 Transformers 和 ONNX 后端。

    推荐理由:提供了从1.5M到34.5M参数的三档模型及多后端支持,便于评估其在不同场景下的部署可行性。

6月17日周三
  1. Hugging Face Blog70

    AWS 发布 Strands Robots SDK,将 LeRobot 封装为 Agent 工具

    AWS 发布 Strands Robots SDK,将 LeRobot 硬件抽象、仿真和数据集封装为 Agent 工具。开发者可通过自然语言编排 Agent,实现从仿真记录、策略运行到真机部署的无缝流程,并支持多机器人编队协调。

    推荐理由:AWS 发布 Strands Robots SDK,将 LeRobot 封装为 Agent 工具,实现从仿真到真机的无缝部署。

6月8日周一
  1. Hugging Face Blog80

    Hugging Face 宣布 OpenEnv 由社区委员会接管并开源

    Hugging Face 宣布 OpenEnv 成为开源智能体强化学习环境标准,由 Meta-PyTorch、Unsloth、Nvidia 等组成的委员会接管。OpenEnv 定位为互操作层,标准化环境发布与部署,支持 Gymnasium API、MCP 协议及 Docker 打包,实现不同训练框架与环境的无缝对接。

    推荐理由:开源社区联合成立委员会接管并标准化智能体强化学习环境接口,推动训练生态互操作。

6月5日周五
  1. Google Research72

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 在 Gemini Enterprise Agent Platform 中推出基于 Agentic RAG 的跨语料检索功能。该框架通过编排、规划、重写和搜索等智能体协作,并引入“充分上下文智能体”进行质量校验与迭代搜索,在 FramesQA 测试中较标准 RAG 准确率提升最高达 34%。

    推荐理由:引入具备上下文完整性校验的 Agentic RAG 机制,通过多智能体迭代搜索提升复杂查询的准确率与可靠性。

  2. Hugging Face Blog84

    NVIDIA 发布 Nemotron 3.5 内容安全模型,支持多模态与自定义策略

    NVIDIA 发布 Nemotron 3.5 内容安全模型,基于 Gemma 3 4B 微调,支持文本与图像的多模态联合评估及 12 种语言。该模型新增自定义企业策略执行与可审计推理(THINK Mode),并开源了包含真实图像的多模态安全数据集。

    推荐理由:Nemotron 3.5 将多模态、多语言与自定义企业策略执行整合于单一模型,提供可审计推理与开源数据集。

6月4日周四
  1. Hugging Face Blog73

    Hugging Face重构hf CLI以优化智能体工作流

    Hugging Face重构hf CLI以适配智能体,通过自动检测环境实现人类与智能体双模式输出。实测显示,在复杂多步任务中,相比手写API调用,使用hf CLI可节省1.3至6倍Token消耗并提升成功率。

    推荐理由:官方重构CLI以适配智能体,实测显示复杂任务可节省1.3至6倍Token消耗。

  2. Google Research70

    Google 开源水文模型框架,赋能全球洪水预报

    Google Research 在 GitHub 开源了驱动 Flood Hub 的水文模型框架,允许气象机构利用本地数据微调模型。该框架包含基于 LSTM 的模型架构和训练管线,升级模型将可靠预测期延长了六天。

    推荐理由:开源了驱动 Flood Hub 的 AI 水文模型框架,允许气象机构利用本地数据微调模型,提升洪水预报能力。

6月3日周三
  1. Hugging Face Blog60

    Reachy Mini 支持通过 MCP 协议调用 Hugging Face Spaces 远程工具

    Hugging Face 宣布 Reachy Mini 对话应用新增 MCP 工具支持,允许通过 Hugging Face Spaces 远程调用天气查询、网络搜索等无状态能力。该功能通过 `reachy-mini-conversation-app tool-spaces add` 命令安装,工具逻辑在 Space 中运行,本地仅保留受信任的核心控制与硬件交互工具。

    推荐理由:Reachy Mini 引入 MCP 协议支持,允许通过 Hugging Face Spaces 远程调用工具,实现了应用本体与外部能力的解耦。

6月2日周二
5月29日周五
5月28日周四
  1. Mistral AI74

    Mistral发布工业AI栈与Vibe智能体,公布自有数据中心计划

    Mistral在AI Now Summit 2026上发布面向工业工程的AI栈,联合空客、宝马和ASML优化设计与仿真。其智能体Vibe升级为统一长程任务工具,支持代码与研究。此外,Mistral宣布将于2026年第三季度在法国Les Ulis启用10MW自有推理数据中心。

    推荐理由:原文披露了面向工业场景的AI栈及Vibe智能体,并公布了自有数据中心计划,展示了从软件到算力的全栈布局。

  2. Mistral AI72

    Mistral AI 发布 Search Toolkit 开源搜索框架

    Mistral AI 发布 Search Toolkit 公共预览版,这是一个用于构建生产级 AI 搜索流水线的开源框架。该工具统一了数据摄入、检索和评估模块,支持 BM25、稠密向量及混合检索,内置召回率、MRR 等评估指标,并提供基于 Docker 的 Vespa 快速启动模板。

    推荐理由:统一了数据摄入、检索与评估流程,降低企业构建高质量搜索基础设施的工程成本。

5月27日周三
  1. Mistral AI70

    Mistral 收购 Emmi AI 推出物理 AI 能力

    Mistral 宣布收购 Emmi AI,推出物理 AI 能力,将传统仿真从小时级加速至秒级。该能力作为 Mistral 企业平台的一部分,支持航空航天、汽车、半导体等领域的工程设计加速与实时数字孪生。

    推荐理由:Mistral 收购 Emmi AI 推出物理 AI 能力,将仿真速度从小时级提升至秒级,为工业工程设计加速提供新方案。

5月22日周五
  1. Mistral AI82

    Mistral 发布 Medium 3.5 模型及云端异步编码智能体

    Mistral 发布 Mistral Medium 3.5 模型,支持云端异步编码智能体与 Le Chat 多步工作模式。该模型为 128B 参数,在 SWE-Bench Verified 上得分 77.6%,API 定价为输入 1.5 美元/百万 token,输出 7.5 美元/百万 token。

    推荐理由:Mistral Medium 3.5 模型发布并支持云端异步编码智能体,提供可配置推理与多工具调用能力。

  2. Mistral AI70

    Mistral Studio 发布 Connectors 功能,支持内置与自定义 MCP 集成

    Mistral AI 在 Studio 中发布 Connectors 功能,允许开发者通过 API/SDK 使用内置连接器及自定义 MCP 协议工具。该功能支持直接工具调用、人工审批流程及跨应用复用,旨在简化企业级 AI 应用的集成与治理。

    推荐理由:官方发布 Connectors 功能,支持内置与自定义 MCP 集成,提供工具调用与人工审批能力。

5月20日周三
  1. Hugging Face Blog68

    OlmoEarth v1.1 发布:计算成本降低至三分之一

    AllenAI 发布 OlmoEarth v1.1 模型系列,通过优化 Transformer 的 Token 设计将计算成本降低至 v1 的三分之一,同时保持基准性能。该版本包含 Base、Tiny 和 Nano 多种尺寸,支持更高效的卫星图像推理与微调。

    推荐理由:通过优化Token设计降低计算成本,为遥感模型的高效部署提供了可复用的工程实践。