跳到正文

#产品更新

今日 2 条
3月5日周四
  1. Hugging Face Blog80

    Hugging Face 发布 Modular Diffusers 模块化扩散模型框架

    Hugging Face 发布 Modular Diffusers,将扩散模型流水线重构为可自由组合的模块化组件。该框架支持自定义代码块、模块化仓库以及可视化节点工具 Mellon 的集成,允许用户灵活插拔和复用模型组件。

    推荐理由:Diffusers 引入模块化架构,允许自由组合和复用扩散模型组件,为自定义工作流和可视化节点工具提供了更灵活的基础。

3月4日周三
  1. Google DeepMind83

    Google 发布 Gemini 3.1 Flash-Lite 模型

    Google 发布 Gemini 3.1 Flash-Lite 模型,定价为输入 0.25 美元/百万 token、输出 1.50 美元/百万 token。该模型在 Artificial Analysis 基准测试中比 2.5 Flash 快 2.5 倍,输出速度提升 45%,并支持自适应思考层级。

    推荐理由:以极低定价和显著提速在保持质量的同时优化了高并发场景的推理成本。

2月27日周五
  1. Google DeepMind83

    Google 发布 Nano Banana 2 图像生成模型

    Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),结合 Pro 级智能与 Flash 速度,支持多主体一致性和精确文本渲染。该模型已上线 Gemini、Search、AI Studio 及 Google Ads 等产品,并集成 SynthID 和 C2PA 溯源技术。

    推荐理由:Nano Banana 2 将 Pro 级能力与 Flash 速度结合,提供多主体一致性和精确文本渲染,适合快速迭代场景。

2月26日周四
  1. Hugging Face Blog75

    Hugging Face Transformers 重构 MoE 权重加载与执行后端

    Hugging Face 重构了 Transformers 库以原生支持 Mixture of Experts (MoE) 架构,引入动态权重加载与专家后端,使 Qwen1.5-110B 等模型加载速度提升数倍,并联合 Unsloth 实现 MoE 训练速度提升约 12 倍。

    推荐理由:Hugging Face重构了MoE模型的权重加载与执行后端,显著提升了大参数模型的加载速度与训练效率。

2月18日周三
  1. Hugging Face Blog75

    Gradio 6 发布 gr.HTML 单文件应用功能

    Gradio 6 发布 gr.HTML 功能,支持自定义模板、作用域 CSS 和 JavaScript 交互。开发者可借助 LLM 在单个 Python 文件中生成前端、后端及状态管理,无需构建步骤即可部署至 Hugging Face Spaces。

    推荐理由:Gradio 6 赋予 gr.HTML 原生模板与交互能力,使开发者能利用 LLM 单文件生成复杂组件,极大简化了 AI 应用的构建与部署流程。

2月13日周五
  1. Google DeepMind85

    Gemini 3 Deep Think 重大升级并开放 API 访问

    Google 发布 Gemini 3 Deep Think 重大升级,在 ARC-AGI-2 等基准上刷新纪录,并首次通过 Gemini API 向研究人员和企业开放。

    推荐理由:更新后的推理模式在多项学术基准上刷新纪录,并首次通过 API 向开发者开放,可据此评估前沿推理能力的落地路径。

2月11日周三
  1. Google Research55

    Google Research 发布开源框架 DialogLab 用于模拟多角色动态人机对话

    Google Research 发布开源原型框架 DialogLab,用于设计、模拟和测试动态多角色人机对话。该框架通过可视化界面解耦社交设置与对话流程,支持拖拽式角色配置与结构化脚本编排。评估显示,其“人工控制”模式在模拟真实人类行为时比全自动或纯响应式代理更具沉浸感和有效性。

2月10日周二
  1. Google DeepMind88

    Google DeepMind发布Gemini Deep Think科研级应用与数学研究智能体

    Google DeepMind发布Gemini Deep Think在数学、物理和计算机科学领域的科研级应用,展示了名为Aletheia的数学研究智能体。该智能体具备自然语言验证和迭代生成能力,能自主解决部分开放数学问题并辅助人类专家。

    推荐理由:展示了Gemini Deep Think在数学与科学领域的科研级应用,提供了可复用的智能体工作流与验证方法。

2月9日周一
  1. Hugging Face Blog78

    Transformers.js v4 发布,支持 WebGPU 与 Node 端侧运行

    Hugging Face 发布 Transformers.js v4,引入基于 C++ 重写的 WebGPU 运行时,支持在浏览器、Node、Bun 和 Deno 中运行 AI 模型。新增 ModelRegistry API 优化生产环境加载,独立出轻量级 Tokenizers.js 库,并新增 GPT-OSS、Mamba 等模型支持。

    推荐理由:引入全新 WebGPU 运行时并支持 Node 端侧运行,显著提升了本地推理性能与部署灵活性。

2月6日周五
2月5日周四
  1. Mistral AI82

    Mistral 发布 Voxtral Transcribe 2 语音模型

    Mistral 发布 Voxtral Transcribe 2 语音转文字模型,包含 Voxtral Mini Transcribe V2 和 Voxtral Realtime。后者采用流式架构,延迟可配置至 200ms 以下,支持 13 种语言,以 Apache 2.0 协议开源权重。

    推荐理由:提供了实时与批量双模型及开源权重,给出了延迟与价格数据,便于评估语音工作流升级。

2月4日周三
  1. Hugging Face Blog62

    Hugging Face 推出社区评测功能,支持去中心化模型分数展示

    Hugging Face 推出社区评测功能,允许模型仓库存储评测分数,数据集仓库自动聚合分数并展示排行榜。社区用户可通过 PR 提交任何模型的评测结果,并附带可复现的 eval.yaml 规范,以解决基准饱和与真实表现脱节的问题。

    推荐理由:Hugging Face 推出去中心化评测机制,允许社区提交并展示模型分数,旨在解决基准饱和与真实表现脱节的问题。

1月30日周五
  1. Google DeepMind72

    Google DeepMind 发布 Project Genie 实验原型

    Google DeepMind 面向美国 Google AI Ultra 订阅用户发布 Project Genie 实验原型,基于 Genie 3 模型提供世界创建、实时探索与混剪功能。该原型支持文本与图像提示词生成动态环境,并允许下载探索视频,目前存在生成时长与物理一致性等已知限制。

    推荐理由:原文给出了世界模型在实时生成与交互上的能力边界,读者可据此评估其在创意探索中的实际可用性。

1月29日周四
  1. Hugging Face Blog72

    Hugging Face 发布 Daggr,用 Python 代码构建可视化 AI 工作流

    Hugging Face 发布开源 Python 库 Daggr,用于连接 Gradio 应用、ML 模型和自定义函数构建 AI 工作流。它自动生成可视化画布,支持检查中间输出、单步重跑和状态持久化,提供 GradioNode、FnNode 和 InferenceNode 三种节点类型。

    推荐理由:Daggr 提供代码优先的可视化工作流编排,支持单步调试与状态持久化,降低多模型组合开发的调试成本。

1月28日周三
  1. Mistral AI72

    Mistral Vibe 2.0 发布,引入自定义子智能体与多选项澄清功能

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,基于 Devstral 2 模型,新增自定义子智能体、多选项澄清、斜杠命令技能及统一智能体模式。Vibe 现已在 Le Chat Pro 和 Team 计划中提供,支持按量付费或自带 API 密钥,Devstral 2 模型也转为付费 API 访问。

    推荐理由:提供了自定义子智能体和多选项澄清等控制能力,有助于开发者构建更可控的终端自动化工作流。

1月20日周二
  1. Hugging Face Blog88

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。

    推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。

1月15日周四
1月14日周三
  1. Google Research75

    Google 发布 MedGemma 1.5 4B 与 MedASR 医疗语音模型

    Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。

    推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。

  2. Google DeepMind72

    Google DeepMind 发布 Veo 3.1 更新:增强参考图生成视频能力并支持原生竖屏与4K

    Google DeepMind 发布 Veo 3.1 更新,强化基于参考图生成视频的能力,提升角色与背景一致性,并新增原生 9:16 竖屏输出及 1080p/4K 超分。新功能已上线 YouTube Shorts、Gemini App、Flow、Gemini API 及 Vertex AI,同时 Gemini App 新增视频 SynthID 水印验证功能。

    推荐理由:更新强化了参考图生成视频的一致性并新增原生竖屏与4K输出,适配移动端与专业工作流。

12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

12月18日周四
  1. Hugging Face Blog68

    Transformers v5 重构分词器:架构与词表分离,支持从零训练

    Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。

    推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。

12月16日周二
  1. Google Research72

    Google 推出 Gemini 论文辅助工具,在 STOC 2026 中验证推理能力

    Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。

    推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。

  2. Hugging Face Blog72

    开源智能体框架CUGA上线Hugging Face Spaces

    IBM Research开源智能体框架CUGA正式集成至Hugging Face Spaces,提供CRM场景演示与可视化开发入口。CUGA支持多工具集成与可配置推理模式,在AppWorld等基准测试中表现优异,兼容gpt-oss-120b与Llama-4等开源模型。

    推荐理由:开源智能体框架CUGA上线Hugging Face Spaces,提供可视化演示与多模型支持,便于开发者快速体验与集成。

12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog70

    llama.cpp 新增 Router 模式支持多模型动态管理

    llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。

    推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。

12月9日周二
  1. Mistral AI88

    Mistral 发布 Devstral 2 编码模型及 Vibe CLI 工具

    Mistral 发布 Devstral 2(123B)和 Devstral Small 2(24B)两款开源编码模型,Devstral 2 在 SWE-bench Verified 上达到 72.2% 得分,API 目前免费。同时推出 Mistral Vibe CLI,这是一款基于 Devstral 的开源终端智能体,支持多文件编排与 IDE 集成。

    推荐理由:Mistral 发布 Devstral 2 编码模型及原生 CLI 工具,提供 SWE-bench 基准数据与部署方案,便于开发者评估开源编码能力。

12月5日周五
12月4日周四
  1. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

12月1日周一
  1. Hugging Face Blog72

    Hugging Face Transformers v5 发布:确立 PyTorch 单后端与模块化设计

    Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。

    推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。

11月26日周三
  1. Google DeepMind40

    AlphaFold:五年影响力回顾

    AlphaFold 2 五年前解决了蛋白质结构预测难题,其预测数据已收录于 AlphaFold Protein Database 并免费开放。该数据库已被全球 300 多万研究人员使用,相关研究被引用超 3.5 万次,并助力 2024 年诺贝尔化学奖的获得。

11月25日周二
  1. Hugging Face Blog35

    Diffusers 支持 FLUX-2

    Diffusers 正式支持 FLUX-2 图像生成模型,提供 Flux2Pipeline 和 Flux2Transformer2DModel 等组件。该模型使用 Mistral3 作为文本编码器,可通过 diffusers/FLUX.2-dev-bnb-4bit 仓库加载,支持 4-bit 量化部署。

11月21日周五
  1. Hugging Face Blog70

    Hugging Face TRL 官方集成 RapidFire AI 实现 20 倍加速微调

    Hugging Face TRL 官方集成 RapidFire AI,通过自适应分块调度与并发训练机制,实现多配置微调加速 16-20 倍。提供实时仪表盘与 IC Ops 功能,支持在训练中途停止低效配置或克隆优化参数,无需重启任务。

    推荐理由:官方集成提供并发微调与实时干预能力,可显著降低多配置对比的时间与算力成本。

11月20日周四
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3 Pro Image 图像生成模型

    Google DeepMind 发布 Gemini 3 Pro Image(代号 Nano Banana Pro),提供 2K/4K 分辨率、高精度文本渲染及物理控制能力。该模型支持通过 Google Search 进行实时知识检索,并内置 SynthID 数字水印,已在 Google AI Studio 和 Vertex AI 开放预览。

    推荐理由:该模型在文本渲染、物理控制和知识检索方面实现升级,开发者可据此构建更精准的多模态应用。

  2. Hugging Face Blog74

    AnyLanguageModel 发布统一 Apple 平台本地与云端 LLM 调用 API

    Hugging Face 发布 AnyLanguageModel,提供 Swift 包统一调用 Apple Foundation Models、Core ML、MLX、llama.cpp、Ollama 及 OpenAI 等模型。开发者只需替换 import 即可切换后端,支持按需引入依赖并扩展图像输入。

    推荐理由:统一了本地与云端模型调用接口,降低 Apple 平台开发者的集成成本。

11月19日周三
  1. Google Research85

    Google 发布端到端实时语音翻译模型并部署于 Google Meet 和 Pixel 10

    Google 发布端到端实时语音翻译模型,延迟仅2秒并保留原声,已在 Google Meet 和 Pixel 10 部署。该模型基于 AudioLM 和 SpectroStream 架构,支持英、西、德、法、意、葡等语言。

    推荐理由:端到端架构将延迟降至2秒并保留原声,已在Google Meet和Pixel 10部署,可据此评估实时语音翻译的技术进展。

11月17日周一
  1. Google DeepMind75

    Google DeepMind 发布 WeatherNext 2 天气预测模型

    Google DeepMind 发布 WeatherNext 2,生成速度提升 8 倍,分辨率达小时级,可预测数百种天气场景。该模型基于 Functional Generative Network 架构,在 99.9% 的变量上超越前代,数据已上线 Earth Engine 和 BigQuery,并升级了 Google Search、Gemini 及 Maps 的天气服务。

    推荐理由:模型速度提升8倍且支持小时级分辨率,通过多场景预测增强极端天气研判能力。

11月14日周五
  1. Google Research61

    Google Research 发布全球天然林地图及AI基准数据集

    Google Research 联合 Google DeepMind 发布 Natural Forests of the World 2020 地图及数据集,利用 MTSViT 模型实现 10 米分辨率天然林识别,准确率达 92.2%。同时发布 Planted 和 ForTy 两个大规模基准数据集,用于支持 EUDR 合规及下一代森林分类模型研发。

    推荐理由:发布全球首个10米分辨率天然林地图及基准数据集,为合规与生态监测提供高精度AI基线。

11月12日周三