跳到正文

全部动态

今日 17 条
8月28日周五
8月27日周四
  1. Google DeepMind82

    Google 发布 Gemini 3.5 Transcribe 语音转写模型

    Google 发布 Gemini 3.5 Transcribe 语音转写模型,提供实时流式(gemini-3.5-transcribe-live)与离线处理(gemini-3.5-transcribe)双 API。该模型支持函数调用、自定义词汇及 85 种语言,流式与非流式 WER 分别达 4.0% 和 2.6%,已集成至 Gemini 应用、Gboard 及 Chrome 等产品。

    推荐理由:模型提供实时与离线双API,WER显著降低并支持函数调用,开发者可据此构建高精度语音交互应用。

8月21日周五
8月20日周四
  1. Mistral AI78

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,提供 search、open、navigate、read、grep 五个工具实现多步检索与验证。在 FinanceBench 和 OfficeQA Pro 基准测试中,准确率最高提升 3 倍,延迟降低 39.6%,Token 消耗减少三分之一。

    推荐理由:通过多步检索与导航工具提升复杂文档查询准确率,同时降低延迟与Token消耗。

8月13日周四
  1. Hugging Face Blog72

    OlmoEarth Studio 开放自定义嵌入向量导出功能

    OlmoEarth Studio 现支持计算并导出自定义嵌入向量,生成轻量级 Cloud-Optimized GeoTIFF (COG) 文件。用户可通过 Studio UI 或 API 选择感兴趣区域、时间范围、编码器变体(Nano/Tiny/Base)及影像源,获取用于相似度搜索、少样本分割、变化检测和 PCA 探索的嵌入数据。

    推荐理由:OlmoEarth Studio 开放自定义嵌入向量导出,提供轻量级 COG 格式及下游应用示例,便于直接复用。

8月12日周三
  1. Google DeepMind85

    Google DeepMind 发布 SL2T 手语翻译模型并集成至 Gboard 和 Live Transcribe

    Google DeepMind 发布多语言手语转文本模型 SL2T,首次集成至 Gboard 和 Live Transcribe,支持 Pixel 11 上的 ASL 到英语的实时流式翻译。该模型基于超过 10 万小时数据训练,采用端侧 MediaPipe Holistic 提取姿态坐标以保护隐私,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩。

    推荐理由:SL2T模型首次落地Gboard与Live Transcribe,提供端侧隐私保护与流式翻译,为听障群体带来全新的交互方式。

  2. Google Research88

    Google 发布 AMIE 实时视频问诊研究:达到专家级临床诊断水平

    Google Research 发布论文,介绍基于 Gemini 和 Project Astra 的 AMIE (Video) 系统,该系统通过异步多智能体架构在实时视频问诊中感知视听线索并引导虚拟体格检查。在 100 个场景、300 次咨询的随机对照研究中,AMIE (Video) 在病史采集、诊断准确性和沟通质量上与 30 名初级保健医生相当,且在引导体格检查方面表现更优。

    推荐理由:研究展示了基于 Gemini 的 AMIE 系统在实时视频问诊中达到专家级水平,为医疗 AI 从文本向视听交互演进提供了实证。

8月11日周二
  1. Hugging Face Blog78

    NVIDIA Magpie TTS 开源多语言语音模型,新增阿拉伯语等三种语言

    NVIDIA 在 Hugging Face 开源 Magpie 多语言 TTS 模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,支持12种语言。该模型提供364M参数开源权重及NIM部署方案,在B200上单流首音频延迟低至32ms,并引入帧堆叠与局部Transformer架构优化推理速度。

    推荐理由:提供开源权重与NIM部署方案,支持12种语言及低延迟指标,适合需要私有化部署和定制语音的开发者。

7月30日周四
  1. Google DeepMind83

    Gemini Robotics ER 2 发布,升级视频理解与多机协作

    Google DeepMind 发布 Gemini Robotics ER 2,升级视频理解、任务编排与多机协作能力。模型通过 Gemini Live API 提供低延迟流式推理,支持进度分类与关键帧定位,开发者可通过 Gemini API 接入。

    推荐理由:模型升级视频理解与多机协作能力,提供 Gemini API 入口,开发者可据此评估物理智能体的任务编排潜力。

7月28日周二
  1. Google DeepMind85

    Google DeepMind 发布 Gemini Robotics 2 智能体模型

    Google DeepMind 发布 Gemini Robotics 2,包含 VLA、ER 和端侧三大模型,赋予机器人全身控制、精细操作与多机协作能力。Gemini Robotics ER 2 已在 Google AI Studio 开放,VLA 模型面向早期合作伙伴。

    推荐理由:原文给出了三大模型的能力边界与开放入口,读者可据此评估其在复杂物理任务中的实际落地价值。

7月27日周一
  1. Hugging Face Blog77

    NVIDIA 发布 Cosmos-H-Dreams 实时手术生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一个用于手术机器人的实时动作条件生成式模拟器。该模型将 Cosmos-H-Surgical-Simulator 蒸馏为因果学生模型,并通过 FlashDreams 加速推理引擎,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 fps 的交互速度。

    推荐理由:NVIDIA 发布 Cosmos-H-Dreams 实时手术模拟器,通过蒸馏和 FlashDreams 引擎实现单卡交互推理,为具身智能提供闭环训练环境。

7月23日周四
  1. Hugging Face Blog76

    Diffusers原生支持Nunchaku Lite 4-bit扩散推理

    Hugging Face Diffusers原生集成Nunchaku Lite,支持4-bit权重与激活量化(W4A4),无需自定义Pipeline即可加载预量化模型。实测在Blackwell GPU上峰值显存降低约50%,推理速度提升约30%,配合torch.compile可提速至1.8倍。

    推荐理由:Nunchaku Lite原生集成至Diffusers,实现4-bit权重与激活量化,显著降低显存占用并提升推理速度。

7月21日周二
  1. Hugging Face Blog72

    Pollen Robotics 发布 Grabette 开源机器人操作数据采集系统

    Pollen Robotics 发布 Grabette,一套低成本开源手持抓取器及配套软件,用于低成本、低门槛地记录机器人操作演示数据。Grabette 包含双摄像头和 IMU,配合 Gripette 机械臂末端执行器,可将人类手部操作转化为标准的 LeRobot 格式数据集并上传至 Hugging Face Hub,旨在通过社区协作解决机器人学习中的数据瓶颈。

    推荐理由:开源低成本手持抓取器及配套软件,降低机器人操作数据采集门槛,推动开放数据集建设。

7月17日周五
  1. Google DeepMind78

    Google 发布 Gemini 3.5 Flash Cyber 安全模型

    Google 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调的轻量级网络安全模型,旨在快速发现、验证和修复漏洞。该模型通过 CodeMender 向政府和受信任合作伙伴有限开放,在内部基准测试中表现优于主版本 Flash 模型。

    推荐理由:模型针对代码安全微调,在内部基准中超越主版本,通过CodeMender限流发布,为安全团队提供低成本高效方案。

7月8日周三
  1. Hugging Face Blog63

    Hugging Face 与 Amazon SageMaker AI 实现一键深度集成

    Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页点击按钮直接进入 SageMaker Studio 进行微调或部署。新环境自动预配置权限,并支持在实例选择时直接查看 GPU 配额。

    推荐理由:一键打通模型发现与部署流程,省去手动配置权限和环境的繁琐步骤。

7月7日周二
  1. Hugging Face Blog70

    微软 Foundry 平台上线 Hugging Face 托管计算服务

    微软在 Build 2026 宣布推出 Foundry Managed Compute,将 Hugging Face 生态中的精选开源模型纳入企业级托管服务。该服务提供一键部署、自动运行时升级与安全扫描,支持 vLLM 等多种推理引擎,并统一了认证、监控与计费接口。

    推荐理由:微软将 Hugging Face 模型纳入企业级托管服务,提供开箱即用的安全与运维能力,降低了开源模型的生产部署门槛。

  2. Hugging Face Blog82

    LeRobot v0.6.0 发布:引入世界模型策略与统一奖励模型API

    LeRobot v0.6.0 发布,引入 VLA-JEPA、LingBot-VA 和 FastWAM 等世界模型策略,以及 Robometer 和 TOPReward 统一奖励模型 API。新增 GR00T N1.7、MolmoAct2 等模型支持,集成六个仿真基准测试,并优化了数据加载、FSDP 训练及 HF Jobs 云训练功能。

    推荐理由:本次更新引入了世界模型策略、统一奖励模型API及多项部署训练优化,为机器人学习闭环提供了更完整的工具链。

  3. Hugging Face Blog78

    Hugging Face 与 SkyPilot 联合推出零出口流量存储方案

    Hugging Face 与 SkyPilot 联合推出 `store: hf` 功能,允许在任意云或本地集群上直接挂载 Hugging Face Hub 上的模型和数据集,读取数据不产生出口流量费用。该方案基于 Xet 存储实现增量去重,支持懒加载和断点续传,显著降低了跨云训练和推理的存储与传输成本。

    推荐理由:通过零出口流量存储和跨云调度,解决了模型数据与算力分离带来的高昂跨云传输成本。

7月6日周一
  1. Hugging Face Blog68

    Hugging Face Kernels 重大更新:引入可信发布与代码签名

    Hugging Face 对 Kernels 项目进行重大更新,在 Hub 上引入 kernel 专属仓库类型,默认启用可信发布者机制并支持代码签名以增强安全性。项目新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,并重构 CLI 以更好地支持智能体开发工作流。

    推荐理由:Hugging Face重构了Kernels项目,引入可信发布与代码签名机制,并新增对Torch Stable ABI和TVM FFI的支持。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 发布实时语音 AI 演示

    Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。

    推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。

  2. Google Research65

    Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集

    Google Research 发布覆盖50+全球城市的建筑级屋顶反射率数据集,并上线 Heat Resilience Earth Engine App。该数据集基于 Sentinel-2 与高分辨率卫星影像融合生成,精度达30厘米,旨在帮助城市规划者识别低反射率建筑并实施降温干预。

    推荐理由:原文提供了覆盖50+城市的建筑级屋顶反射率数据集及可视化应用,为城市热岛缓解规划提供了高精度数据支持。

6月30日周二
6月25日周四
  1. Hugging Face Blog75

    NVIDIA NeMo AutoModel 发布,基于 Transformers v5 加速 MoE 微调

    NVIDIA 发布 NeMo AutoModel,基于 HuggingFace Transformers v5 提供专家并行、DeepEP 融合通信和 TransformerEngine 内核。在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B-A3B 上,训练吞吐量提升 3.4-3.7 倍,GPU 显存降低 29-32%,并支持 550B 模型全量微调。

    推荐理由:NeMo AutoModel 在保持 Transformers v5 API 兼容的前提下,通过专家并行和内核优化显著提升 MoE 微调性能。

6月22日周一
  1. Hugging Face Blog68

    PP-OCRv6 发布:支持50种语言的轻量级OCR模型

    PaddleOCR 发布 PP-OCRv6 模型家族,包含 1.5M 至 34.5M 参数的三档模型,支持 50 种语言。medium 版本检测 Hmean 达 86.2%,较 v5 提升 4.6 个百分点,提供 Transformers 和 ONNX 后端。

    推荐理由:提供了从1.5M到34.5M参数的三档模型及多后端支持,便于评估其在不同场景下的部署可行性。

6月17日周三
6月8日周一
  1. Hugging Face Blog80

    Hugging Face 宣布 OpenEnv 由社区委员会接管并开源

    Hugging Face 宣布 OpenEnv 成为开源智能体强化学习环境标准,由 Meta-PyTorch、Unsloth、Nvidia 等组成的委员会接管。OpenEnv 定位为互操作层,标准化环境发布与部署,支持 Gymnasium API、MCP 协议及 Docker 打包,实现不同训练框架与环境的无缝对接。

    推荐理由:开源社区联合成立委员会接管并标准化智能体强化学习环境接口,推动训练生态互操作。

6月5日周五
  1. Google Research72

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 在 Gemini Enterprise Agent Platform 中推出基于 Agentic RAG 的跨语料检索功能。该框架通过编排、规划、重写和搜索等智能体协作,并引入“充分上下文智能体”进行质量校验与迭代搜索,在 FramesQA 测试中较标准 RAG 准确率提升最高达 34%。

    推荐理由:引入具备上下文完整性校验的 Agentic RAG 机制,通过多智能体迭代搜索提升复杂查询的准确率与可靠性。

  2. Hugging Face Blog84

    NVIDIA 发布 Nemotron 3.5 内容安全模型,支持多模态与自定义策略

    NVIDIA 发布 Nemotron 3.5 内容安全模型,基于 Gemma 3 4B 微调,支持文本与图像的多模态联合评估及 12 种语言。该模型新增自定义企业策略执行与可审计推理(THINK Mode),并开源了包含真实图像的多模态安全数据集。

    推荐理由:Nemotron 3.5 将多模态、多语言与自定义企业策略执行整合于单一模型,提供可审计推理与开源数据集。

6月4日周四
  1. Hugging Face Blog73

    Hugging Face重构hf CLI以优化智能体工作流

    Hugging Face重构hf CLI以适配智能体,通过自动检测环境实现人类与智能体双模式输出。实测显示,在复杂多步任务中,相比手写API调用,使用hf CLI可节省1.3至6倍Token消耗并提升成功率。

    推荐理由:官方重构CLI以适配智能体,实测显示复杂任务可节省1.3至6倍Token消耗。

  2. Google Research70

    Google 开源水文模型框架,赋能全球洪水预报

    Google Research 在 GitHub 开源了驱动 Flood Hub 的水文模型框架,允许气象机构利用本地数据微调模型。该框架包含基于 LSTM 的模型架构和训练管线,升级模型将可靠预测期延长了六天。

    推荐理由:开源了驱动 Flood Hub 的 AI 水文模型框架,允许气象机构利用本地数据微调模型,提升洪水预报能力。

6月3日周三
  1. Hugging Face Blog60

    Reachy Mini 支持通过 MCP 协议调用 Hugging Face Spaces 远程工具

    Hugging Face 宣布 Reachy Mini 对话应用新增 MCP 工具支持,允许通过 Hugging Face Spaces 远程调用天气查询、网络搜索等无状态能力。该功能通过 `reachy-mini-conversation-app tool-spaces add` 命令安装,工具逻辑在 Space 中运行,本地仅保留受信任的核心控制与硬件交互工具。

    推荐理由:Reachy Mini 引入 MCP 协议支持,允许通过 Hugging Face Spaces 远程调用工具,实现了应用本体与外部能力的解耦。

5月29日周五
5月20日周三
  1. Google Research73

    Google 发布 ERA 科研工具并推出计算发现平台

    Google 发布 Empirical Research Assistance (ERA) 工具,利用 Gemini 通过树搜索方法编写和优化科学代码,在基因组学、流行病学预测、碳监测等基准测试中达到专家级性能。同时推出基于 ERA 和 AlphaEvolve 的计算发现平台 Computational Discovery,并开放 Gemini for Science 实验工具供注册使用。

    推荐理由:ERA 工具通过树搜索优化科学代码,已在多项基准测试中达到专家级水平,并开放给科研社区使用。

5月19日周二
  1. Hugging Face Blog80

    Hugging Face 发布 Ettin Reranker 系列模型

    Hugging Face 发布基于 Ettin ModernBERT 架构的六个 CrossEncoder 重排序模型(17M 至 1B 参数),采用点均方误差蒸馏自 mxbai-rerank-large-v2。在 MTEB 和 NanoBEIR 基准测试中,各尺寸模型均达到同规模下的最优精度,且得益于未填充注意力机制,推理速度比同类模型快 1.7 至 8.3 倍。

    推荐理由:基于ModernBERT架构蒸馏出六个尺寸模型,在同等参数量下精度超越主流模型且推理速度显著领先。

5月18日周一
  1. Hugging Face Blog60

    PaddleOCR 3.5 新增 Transformers 推理后端

    PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 使用 Hugging Face Transformers 作为推理后端。该更新让 PP-OCRv5 等模型更自然地融入基于 Transformers 的 RAG 和 Agent 工作流,同时保留原有 Paddle 后端以保障吞吐量。

    推荐理由:PaddleOCR 3.5 新增 Transformers 推理后端,降低在 Hugging Face 生态中集成文档解析的门槛。

  2. Google DeepMind42

    Project Genie 新增 Street View 功能,支持基于真实地点生成虚拟世界

    Google DeepMind 在 Project Genie 中新增 Street View 功能,允许用户基于美国真实地点生成可交互的虚拟世界。该功能结合 Maps Imagery Grounding 技术,支持“Ocean World”等风格,用户可自定义角色探索或重塑现实场景。Project Genie 现已面向全球 18 岁以上 Google AI Ultra 订阅用户开放。

5月17日周日
  1. Google DeepMind70

    Google 发布 Gemini for Science 实验工具与科学技能

    Google 发布 Gemini for Science,包含 Google Labs 上的三个实验工具:基于 Co-Scientist 的假设生成、基于 AlphaEvolve 的计算发现、基于 NotebookLM 的文献洞察,以及集成 AlphaFold 等数据库的 Google Antigravity 科学技能。

    推荐理由:Google 发布 Gemini for Science 系列实验工具与技能,覆盖假设生成、计算发现与文献洞察,提供科研加速新路径。