IBM 发布 Granite 4.1 系列开源大语言模型
IBM 发布 Granite 4.1 系列(3B、8B、30B)开源大语言模型,采用 Apache 2.0 协议。该系列在约 15T tokens 上预训练并支持 512K 上下文,通过多阶段强化学习显著提升了数学、编码和工具调用能力。其中 8B 模型在多项基准上匹敌或超越前代 32B MoE 模型。
推荐理由:原文详述了数据工程与多阶段强化学习等训练细节,展示了8B密集模型在多项基准上匹敌更大MoE架构的能力。
IBM 发布 Granite 4.1 系列(3B、8B、30B)开源大语言模型,采用 Apache 2.0 协议。该系列在约 15T tokens 上预训练并支持 512K 上下文,通过多阶段强化学习显著提升了数学、编码和工具调用能力。其中 8B 模型在多项基准上匹敌或超越前代 32B MoE 模型。
推荐理由:原文详述了数据工程与多阶段强化学习等训练细节,展示了8B密集模型在多项基准上匹敌更大MoE架构的能力。
DeepInfra 正式成为 Hugging Face Hub 的 Inference Provider,支持 DeepSeek V4、Kimi-K2.6、GLM-5.1 等 100 多款模型。
NVIDIA 在 Hugging Face 开源 Nemotron 3 Nano Omni 多模态理解模型,原生支持文档、图像、视频和音频的联合推理及智能体操作。该模型基于 Nemotron 3 混合 Mamba-Transformer 架构,在文档理解、视频分析和语音交互等基准测试中表现领先,并提供 BF16、FP8 和 NVFP4 权重下载。
推荐理由:NVIDIA 开源 Nemotron 3 Nano Omni 模型,原生支持图文音视频多模态理解与智能体操作,在多项基准上表现领先。
Hugging Face 展示了基于 OpenAI 开源隐私过滤模型 Privacy Filter 构建的三个 Web 应用:文档隐私探索器、图像匿名化工具和智能文本脱敏服务。该模型支持 128k 上下文,可识别八类个人敏感信息。
推荐理由:Hugging Face 展示了基于 OpenAI Privacy Filter 构建的三个 Web 应用,揭示了其在文档、图像和文本场景中的工程实践。
LinkedIn 团队分享了在 verl 框架下对 GPT-OSS 进行智能体强化学习训练的实践经验,通过修复 MoE 架构下的对数概率不匹配、在 FlashAttention v3 中实现 Attention Sink 反向传播以及优化 FSDP 内存占用,解决了训练不稳定和显存爆炸问题,实现了模型在数学推理和工具调用任务上的稳定收敛。
推荐理由:文章详细记录了GPT-OSS在 verl 框架下实现智能体强化学习的关键工程修复,为开源模型部署提供了可复用的技术路径。
Hugging Face 发布 AssetOpsBench,这是一个针对工业资产生命周期管理的 AI 智能体评测基准,涵盖 230 万传感器遥测点和 140 多个场景。该基准通过六个维度评估智能体表现,并引入 TrajFM 管道分析多智能体执行轨迹中的失败模式。社区测试显示,GPT-4.1 在规划和执行任务中得分最高,但尚无模型达到 85 分的部署就绪阈值。
推荐理由:原文提供了工业场景下的多维评测框架与失败模式分析,为开发者优化多智能体协作提供了可迁移的评估方法。
DeepSeek R1 发布一周年,推动中国 AI 从封闭转向开源生态,降低技术、采用和心理门槛。百度在 Hugging Face 的开源仓库从 2024 年的零个激增至 2025 年的 100 多个,字节跳动和腾讯发布量增长八至九倍,月之暗面 Kimi K2 开源引发关注。
Overworld 发布 Waypoint-1,支持通过文本、鼠标和键盘进行零延迟实时交互的视频扩散模型。该模型基于 10,000 小时游戏视频训练,配合 WorldEngine 推理库,在 RTX 5090 上可实现 30 FPS 或 60 FPS 的流畅体验。
推荐理由:模型支持零延迟的实时交互控制,并在消费级硬件上实现高帧率,为端侧视频生成提供了新的交互范式。
Hugging Face 联合社区发布 Open Responses 开源推理标准,基于 OpenAI Responses API 扩展。该标准支持原生 Agent 循环、加密推理及工具调用,旨在统一 Agent 推理接口。
推荐理由:Open Responses 将 OpenAI 的 Responses API 开源并标准化,为 Agent 推理提供统一接口。
TII 发布 Falcon-H1-Arabic 系列模型,包含 3B、7B 和 34B 三个版本。该系列采用混合 Mamba-Transformer 架构,上下文窗口最高达 256K tokens,在 OALL 等基准测试中刷新阿拉伯语模型纪录。
推荐理由:采用混合架构并大幅提升上下文窗口,在阿拉伯语基准上刷新纪录,为长文档处理提供新方案。
Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。
推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。
IBM Research开源智能体框架CUGA正式集成至Hugging Face Spaces,提供CRM场景演示与可视化开发入口。CUGA支持多工具集成与可配置推理模式,在AppWorld等基准测试中表现优异,兼容gpt-oss-120b与Llama-4等开源模型。
推荐理由:开源智能体框架CUGA上线Hugging Face Spaces,提供可视化演示与多模型支持,便于开发者快速体验与集成。
Hugging Face 发布 swift-huggingface,为 Swift 应用提供完整的 Hugging Face Hub 客户端支持。该库解决了大模型下载中断无法续传、缺乏 Python 共享缓存及认证复杂等痛点,支持断点续传、OAuth 2.0 认证及与 Python 生态兼容的缓存结构。
Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。
推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。
Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。
推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。
Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。
Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。
推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。
Diffusers 正式支持 FLUX-2 图像生成模型,提供 Flux2Pipeline 和 Flux2Transformer2DModel 等组件。该模型使用 Mistral3 作为文本编码器,可通过 diffusers/FLUX.2-dev-bnb-4bit 仓库加载,支持 4-bit 量化部署。
Hugging Face 发布 Open ASR Leaderboard 新论文,基于60余模型和11个数据集对比,揭示多语言与长音频场景下的性能权衡与开源进展。
推荐理由:基于60余模型和11个数据集的对比,揭示了多语言与长音频场景下的性能权衡与开源进展。
Hugging Face TRL 官方集成 RapidFire AI,通过自适应分块调度与并发训练机制,实现多配置微调加速 16-20 倍。提供实时仪表盘与 IC Ops 功能,支持在训练中途停止低效配置或克隆优化参数,无需重启任务。
推荐理由:官方集成提供并发微调与实时干预能力,可显著降低多配置对比的时间与算力成本。
Hugging Face 发布 AnyLanguageModel,提供 Swift 包统一调用 Apple Foundation Models、Core ML、MLX、llama.cpp、Ollama 及 OpenAI 等模型。开发者只需替换 import 即可切换后端,支持按需引入依赖并扩展图像输入。
推荐理由:统一了本地与云端模型调用接口,降低 Apple 平台开发者的集成成本。
AMD 联合 Hugging Face 与 Data Monsters 举办 AMD Open Robotics Hackathon,面向 18 岁以上参与者开放报名。
Hugging Face发布深度分析,指出美国出口管制反而加速了中国国产芯片与开源模型的协同创新。DeepSeek、Qwen等模型通过架构优化降低推理成本,并率先适配华为昇腾等国产硬件。这种“非NVIDIA优先”策略正在催生独立于CUDA的软件生态,推动全球AI基础设施向多极化演变。
推荐理由:文章梳理了美国出口管制如何倒逼中国加速国产芯片与开源模型协同创新,揭示了全球AI算力格局的重构路径。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的医疗机器人端到端工作流。通过结合 93% 仿真数据与真实遥操作数据微调 GR00T N1.5 模型,实现从数据采集、训练到硬件部署的 Sim2Real 闭环。
推荐理由:提供了从仿真到部署的完整代码与硬件配置,可直接复现医疗机器人工作流。
Hugging Face 发布 LeRobot v0.4.0,引入 Datasets v3.0 及编辑工具,支持 LIBERO 和 Meta-World 仿真环境,并集成 Physical Intelligence 的 PI0.5 和 NVIDIA 的 GR00T N1.5 模型。
推荐理由:LeRobot v0.4.0 升级了数据集与训练工具,并集成 PI0.5 和 GR00T N1.5 等前沿模型,为具身智能开发提供了更完整的开源方案。
Meta与Hugging Face联合推出OpenEnv Hub,提供标准化的智能体沙箱环境。同时发布OpenEnv 0.1规范(RFC),定义工具、API及执行上下文,支持RL训练与部署。
推荐理由:Meta与Hugging Face联合推出OpenEnv Hub及规范,为智能体提供标准化的沙箱环境以支持训练与部署。
Hugging Face 与 VirusTotal 达成合作,对 Hub 上 220 万+ 公开模型和数据集仓库进行持续扫描。通过比对文件哈希值,用户可在下载前查看文件在 VirusTotal 数据库中的恶意软件检测状态及威胁情报,无需上传原始文件内容,从而提升开源 AI 协作的安全性。
Hugging Face 宣布 Sentence Transformers 从达姆施塔特工业大学 UKP Lab 正式转入 Hugging Face,由 Tom Aarsen 继续领导项目。该项目拥有超过 16,000 个公开模型和百万级月活用户,将继续保持 Apache 2.0 开源协议和社区驱动模式。
推荐理由:Sentence Transformers 正式并入 Hugging Face,由官方接手维护,为开源嵌入生态带来更稳定的基础设施支持。
Hugging Face 发布指南,对比了 Nanonets-OCR2、OlmOCR-2、Granite-Docling 等开源OCR模型的能力与成本,介绍了 OlmOCR-Bench 等评测基准,并提供了基于 vLLM 和 Transformers 的本地部署与批量推理代码。
推荐理由:系统梳理了多款开源OCR模型的能力差异与评测基准,并提供了本地部署与批量推理的实操代码。
Google Cloud C4 虚拟机配合 Intel Xeon 6 处理器,使 OpenAI GPT OSS 大语言模型的推理总拥有成本(TCO)较上一代 C3 虚拟机降低 70%。该配置在吞吐量方面实现 1.4 倍至 1.7 倍提升,且每小时价格更低。
Hugging Face 发布教程,指导用户通过 Optimum Intel 和 OpenVINO 在 Intel CPU 上运行 SmolVLM2-256M-Video-Instruct 视觉语言模型。教程涵盖将模型转换为 OpenVINO IR、应用权重或静态量化以优化内存和推理速度,以及执行推理的具体步骤。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度人口、地理和文化分布的合成数据集,包含 2100 万个角色记录,支持英语和印地语。该数据集基于 NeMo Data Designer 生成,覆盖 27 个字段,旨在解决印度多语言 AI 训练的数据缺口,支持开发者微调本地化模型。
推荐理由:NVIDIA 发布首个对齐印度人口分布的合成数据集,为多语言 AI 微调提供隐私安全的数据基础。
BigCode 发布 BigCodeArena,首个支持代码实际执行与人类投票的模型对比平台,并开源了包含1.4万对话的社区数据。同时推出 BigCodeReward 和 AutoCodeArena 两个新基准,利用执行结果显著提升奖励模型对齐度,并在自动化评测中显示 GPT-5 等模型表现领先。
推荐理由:平台引入代码执行反馈机制,并开源了包含1.4万对话的社区评测数据及自动化基准,为代码模型评估提供了新标准。
Hugging Face 发布教程详解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为 Core ML 格式以在 Apple 设备上运行。文章通过简化模型结构、修复 PyTorch 到 CoreML 转换中的算子报错,成功将模型部署至端侧,并预告后续将介绍 MLX 集成与 Neural Engine 量化优化。
推荐理由:详细拆解了将3B参数OCR模型适配Core ML的具体步骤与踩坑经验,为端侧部署提供了可复用的工程参考。
Hugging Face 发布检索嵌入基准(RTEB)Beta 版,旨在通过混合开放与私有数据集策略,可靠评估嵌入模型在真实应用中的检索准确性。该基准涵盖 20 种语言及法律、医疗等关键领域,默认使用 NDCG@10 作为排行榜指标,以解决现有基准存在的泛化差距和与企业用例脱节问题。
Hugging Face 博客展示了在 Intel Core Ultra 上利用 OpenVINO.GenAI 加速 Qwen3-8B 的方法。通过剪枝 Qwen3-0.6B 草稿模型并配合推测解码,推理速度提升约 1.4 倍,并结合 smolagents 实现了高效的本地 AI Agent。
NVIDIA 发布首个面向日本市场的开源合成数据集 Nemotron-Personas-Japan,包含600万条自然日语人设记录,覆盖1500余种职业及多维人口统计属性。该数据集基于 NeMo Data Designer 生成,不依赖真实个人信息,旨在支持日本大语言模型的本地化微调与合规应用。
Hugging Face 开源了 Smol2Operator 项目,展示了如何将轻量级视觉语言模型 SmolVLM2-2.2B-Instruct 训练为具备 GUI 操作能力的智能体。项目包含两阶段训练策略、统一动作空间转换工具、两个处理后的数据集及最终模型,在 ScreenSpot-v2 基准测试中取得了显著性能提升。
推荐理由:开源了基于SmolVLM2训练GUI智能体的全流程与模型,提供了可复现的数据处理工具与统一动作空间方案。
ServiceNow 发布 SyGra 框架,支持低代码/无代码方式生成结构化、领域特定的高质量数据集。该框架兼容 vLLM、Ollama 等推理后端,可处理 Q&A 生成、DPO 偏好对构建、推理增强及跨语言转换等任务。
推荐理由:ServiceNow 发布 SyGra 框架,提供低代码方式生成 SFT、DPO 等高质量训练数据,降低数据工程门槛。
Scaleway 正式成为 Hugging Face Hub 支持的 Inference Provider,支持 gpt-oss、Qwen3、DeepSeek R1 和 Gemma 3 等模型。