跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

133条精选相关主题模型发布行业动态AI 编码

最新精选

第 81–100 条 · 共 133 条
6月30日周二
6月27日周六
6月25日周四
  1. Hugging Face Blog75

    NVIDIA NeMo AutoModel 发布,基于 Transformers v5 加速 MoE 微调

    NVIDIA 发布 NeMo AutoModel,基于 HuggingFace Transformers v5 提供专家并行、DeepEP 融合通信和 TransformerEngine 内核。在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B-A3B 上,训练吞吐量提升 3.4-3.7 倍,GPU 显存降低 29-32%,并支持 550B 模型全量微调。

    推荐理由:NeMo AutoModel 在保持 Transformers v5 API 兼容的前提下,通过专家并行和内核优化显著提升 MoE 微调性能。

6月24日周三
  1. Hugging Face Blog67

    Hugging Face 联合 Treble 推出 FFASR 远场语音识别基准

    Hugging Face 联合 Treble 推出首个开源远场语音识别(FFASR)基准,覆盖 14 种模拟房间与多信噪比条件。评测显示远场低信噪比下的字错误率显著高于近场,并提供准确率与推理速度的权衡分析。

    推荐理由:首次公开远场语音识别基准,提供仿真与实测对照,直观展示真实声学环境下的性能差距。

6月22日周一
  1. Hugging Face Blog68

    PP-OCRv6 发布:支持50种语言的轻量级OCR模型

    PaddleOCR 发布 PP-OCRv6 模型家族,包含 1.5M 至 34.5M 参数的三档模型,支持 50 种语言。medium 版本检测 Hmean 达 86.2%,较 v5 提升 4.6 个百分点,提供 Transformers 和 ONNX 后端。

    推荐理由:提供了从1.5M到34.5M参数的三档模型及多后端支持,便于评估其在不同场景下的部署可行性。

6月17日周三
  1. Hugging Face Blog70

    AWS 发布 Strands Robots SDK,将 LeRobot 封装为 Agent 工具

    AWS 发布 Strands Robots SDK,将 LeRobot 硬件抽象、仿真和数据集封装为 Agent 工具。开发者可通过自然语言编排 Agent,实现从仿真记录、策略运行到真机部署的无缝流程,并支持多机器人编队协调。

    推荐理由:AWS 发布 Strands Robots SDK,将 LeRobot 封装为 Agent 工具,实现从仿真到真机的无缝部署。

6月8日周一
  1. Hugging Face Blog80

    Hugging Face 宣布 OpenEnv 由社区委员会接管并开源

    Hugging Face 宣布 OpenEnv 成为开源智能体强化学习环境标准,由 Meta-PyTorch、Unsloth、Nvidia 等组成的委员会接管。OpenEnv 定位为互操作层,标准化环境发布与部署,支持 Gymnasium API、MCP 协议及 Docker 打包,实现不同训练框架与环境的无缝对接。

    推荐理由:开源社区联合成立委员会接管并标准化智能体强化学习环境接口,推动训练生态互操作。

6月5日周五
  1. Google Research72

    Google 发布 Gemini Enterprise Agent Platform 的 Agentic RAG 功能

    Google 在 Gemini Enterprise Agent Platform 中推出基于 Agentic RAG 的跨语料检索功能。该框架通过编排、规划、重写和搜索等智能体协作,并引入“充分上下文智能体”进行质量校验与迭代搜索,在 FramesQA 测试中较标准 RAG 准确率提升最高达 34%。

    推荐理由:引入具备上下文完整性校验的 Agentic RAG 机制,通过多智能体迭代搜索提升复杂查询的准确率与可靠性。

  2. Hugging Face Blog84

    NVIDIA 发布 Nemotron 3.5 内容安全模型,支持多模态与自定义策略

    NVIDIA 发布 Nemotron 3.5 内容安全模型,基于 Gemma 3 4B 微调,支持文本与图像的多模态联合评估及 12 种语言。该模型新增自定义企业策略执行与可审计推理(THINK Mode),并开源了包含真实图像的多模态安全数据集。

    推荐理由:Nemotron 3.5 将多模态、多语言与自定义企业策略执行整合于单一模型,提供可审计推理与开源数据集。

6月4日周四
  1. Hugging Face Blog73

    Hugging Face重构hf CLI以优化智能体工作流

    Hugging Face重构hf CLI以适配智能体,通过自动检测环境实现人类与智能体双模式输出。实测显示,在复杂多步任务中,相比手写API调用,使用hf CLI可节省1.3至6倍Token消耗并提升成功率。

    推荐理由:官方重构CLI以适配智能体,实测显示复杂任务可节省1.3至6倍Token消耗。

  2. Google Research70

    Google 开源水文模型框架,赋能全球洪水预报

    Google Research 在 GitHub 开源了驱动 Flood Hub 的水文模型框架,允许气象机构利用本地数据微调模型。该框架包含基于 LSTM 的模型架构和训练管线,升级模型将可靠预测期延长了六天。

    推荐理由:开源了驱动 Flood Hub 的 AI 水文模型框架,允许气象机构利用本地数据微调模型,提升洪水预报能力。

6月3日周三
  1. Hugging Face Blog60

    Reachy Mini 支持通过 MCP 协议调用 Hugging Face Spaces 远程工具

    Hugging Face 宣布 Reachy Mini 对话应用新增 MCP 工具支持,允许通过 Hugging Face Spaces 远程调用天气查询、网络搜索等无状态能力。该功能通过 `reachy-mini-conversation-app tool-spaces add` 命令安装,工具逻辑在 Space 中运行,本地仅保留受信任的核心控制与硬件交互工具。

    推荐理由:Reachy Mini 引入 MCP 协议支持,允许通过 Hugging Face Spaces 远程调用工具,实现了应用本体与外部能力的解耦。

6月2日周二
5月29日周五
5月20日周三
  1. Hugging Face Blog68

    OlmoEarth v1.1 发布:计算成本降低至三分之一

    AllenAI 发布 OlmoEarth v1.1 模型系列,通过优化 Transformer 的 Token 设计将计算成本降低至 v1 的三分之一,同时保持基准性能。该版本包含 Base、Tiny 和 Nano 多种尺寸,支持更高效的卫星图像推理与微调。

    推荐理由:通过优化Token设计降低计算成本,为遥感模型的高效部署提供了可复用的工程实践。

  2. Google Research73

    Google 发布 ERA 科研工具并推出计算发现平台

    Google 发布 Empirical Research Assistance (ERA) 工具,利用 Gemini 通过树搜索方法编写和优化科学代码,在基因组学、流行病学预测、碳监测等基准测试中达到专家级性能。同时推出基于 ERA 和 AlphaEvolve 的计算发现平台 Computational Discovery,并开放 Gemini for Science 实验工具供注册使用。

    推荐理由:ERA 工具通过树搜索优化科学代码,已在多项基准测试中达到专家级水平,并开放给科研社区使用。

5月19日周二
  1. Hugging Face Blog80

    Hugging Face 发布 Ettin Reranker 系列模型

    Hugging Face 发布基于 Ettin ModernBERT 架构的六个 CrossEncoder 重排序模型(17M 至 1B 参数),采用点均方误差蒸馏自 mxbai-rerank-large-v2。在 MTEB 和 NanoBEIR 基准测试中,各尺寸模型均达到同规模下的最优精度,且得益于未填充注意力机制,推理速度比同类模型快 1.7 至 8.3 倍。

    推荐理由:基于ModernBERT架构蒸馏出六个尺寸模型,在同等参数量下精度超越主流模型且推理速度显著领先。

5月18日周一
  1. Hugging Face Blog60

    PaddleOCR 3.5 新增 Transformers 推理后端

    PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 使用 Hugging Face Transformers 作为推理后端。该更新让 PP-OCRv5 等模型更自然地融入基于 Transformers 的 RAG 和 Agent 工作流,同时保留原有 Paddle 后端以保障吞吐量。

    推荐理由:PaddleOCR 3.5 新增 Transformers 推理后端,降低在 Hugging Face 生态中集成文档解析的门槛。

  2. Google DeepMind92

    Google 发布 Gemini Omni Flash 多模态视频生成模型

    Google 发布 Gemini Omni Flash,支持将图像、音频、视频和文本作为输入生成高质量视频,并可通过自然语言对话进行编辑。该模型已面向 Google AI Plus、Pro 和 Ultra 订阅用户以及 YouTube Shorts 用户开放。

    推荐理由:原文给出了多模态输入生成视频的能力细节和开放入口,读者可以据此判断它对现有视频创作工作流的影响。