Mistral 收购 Emmi AI 推出物理 AI 能力
Mistral 宣布收购 Emmi AI,推出物理 AI 能力,将传统仿真从小时级加速至秒级。该能力作为 Mistral 企业平台的一部分,支持航空航天、汽车、半导体等领域的工程设计加速与实时数字孪生。
推荐理由:Mistral 收购 Emmi AI 推出物理 AI 能力,将仿真速度从小时级提升至秒级,为工业工程设计加速提供新方案。
Mistral 宣布收购 Emmi AI,推出物理 AI 能力,将传统仿真从小时级加速至秒级。该能力作为 Mistral 企业平台的一部分,支持航空航天、汽车、半导体等领域的工程设计加速与实时数字孪生。
推荐理由:Mistral 收购 Emmi AI 推出物理 AI 能力,将仿真速度从小时级提升至秒级,为工业工程设计加速提供新方案。
Hugging Face TRL 发布 Delta Weight Sync 功能,利用 bf16 权重在相邻 RL 优化步骤间 99% 不变的稀疏特性,仅上传变更的权重补丁至 Hub Bucket。该方案将 Qwen3-0.6B 的每步传输数据从 1.2 GB 降至 20-35 MB,使训练端与推理端无需共享网络即可通过对象存储异步同步权重。
推荐理由:通过稀疏权重同步将异步RL每步传输量降低两个数量级,实现无需共享集群的分布式训练。
Mistral AI 在 Studio 中发布 Connectors 功能,允许开发者通过 API/SDK 使用内置连接器及自定义 MCP 协议工具。该功能支持直接工具调用、人工审批流程及跨应用复用,旨在简化企业级 AI 应用的集成与治理。
推荐理由:官方发布 Connectors 功能,支持内置与自定义 MCP 集成,提供工具调用与人工审批能力。
Hugging Face 在 transformers 库中实现了连续批处理的异步优化,通过 CUDA streams 和 events 解耦 CPU 与 GPU 工作流,使 GPU 利用率从 76.0% 提升至 99.4%,生成时间缩短 22%。
推荐理由:文章通过解耦CPU和GPU工作流实现异步批处理,使GPU利用率提升至99.4%,为长文本推理提供了可复用的工程优化方案。
AWS 发布文章解析基础模型训练与推理的开源软件栈与基础设施集成架构。文章涵盖 P5 和 P6 实例系列的 H100、H200、B200 及 B300 GPU 规格,以及 Slurm、Kubernetes、PyTorch 和 Prometheus 等工具在资源管理与可观测性中的应用。
Berkeley AI Research 发布长文综述自适应并行推理(APR),探讨模型如何自主决定何时分解任务、生成多少并发线程及如何协调。文章对比了 Multiverse 修改推理引擎复用 KV Cache 与 ThreadWeaver 保持引擎不变在客户端拼接的方案,并分析了 SFT 演示与基于关键路径长度的奖励设计。
推荐理由:系统梳理了自适应并行推理的范式,对比了修改推理引擎与客户端编排两种执行路径的优劣。
ServiceNow 分享了将推理引擎从 vLLM V0 迁移到 V1 时消除训练推理偏差的实践。通过修复 logprobs 语义、关闭 prefix caching、调整 inflight weight update 路径以及使用 fp32 lm_head,最终使 V1 的训练轨迹与 V0 参考保持一致。
推荐理由:原文拆解了 vLLM V1 迁移中导致训练轨迹偏离的四个关键后端差异,提供了可复用的对齐方案。
DeepInfra 正式成为 Hugging Face Hub 的 Inference Provider,支持 DeepSeek V4、Kimi-K2.6、GLM-5.1 等 100 多款模型。
Hugging Face 展示了基于 OpenAI 开源隐私过滤模型 Privacy Filter 构建的三个 Web 应用:文档隐私探索器、图像匿名化工具和智能文本脱敏服务。该模型支持 128k 上下文,可识别八类个人敏感信息。
推荐理由:Hugging Face 展示了基于 OpenAI Privacy Filter 构建的三个 Web 应用,揭示了其在文档、图像和文本场景中的工程实践。
Hugging Face 发布教程,展示如何在 Manifest V3 约束下使用 Transformers.js 构建 Chrome 扩展。文章以 Gemma 4 为例,详解了后台服务工作者托管模型、侧边栏 UI 与内容脚本的通信架构,以及本地工具调用与数据持久化实现。
推荐理由:原文拆解了基于 Manifest V3 的 Chrome 扩展架构,展示了如何在后台服务工作者中托管本地模型并实现工具调用。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,通过解耦计算岛实现跨广域网的低带宽、高弹性训练。在 Gemma 4 模型测试中,该系统在硬件故障下保持高可用性与同等基准性能,并在 120 亿参数模型训练中实现比传统方法快 20 倍的速度。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,通过轨迹提升、状态迭代随机化及梯度重塑解决长视界规划难题。该方法将轨迹映射至虚拟状态实现时间并行优化,避免高维视觉模型中的脆弱梯度,使长视界规划更具鲁棒性。
Hugging Face 发布了一个 Skill 和测试工具,帮助开发者将语言模型从 transformers 快速移植到 mlx-lm。该 Skill 可自动处理环境配置、代码转换及数值比对,并生成包含详细报告的 PR。配套的独立测试工具用于验证结果,旨在缓解 Agent 时代开源维护者面临的 PR 激增压力。
推荐理由:Hugging Face 开源了将模型从 transformers 移植到 mlx-lm 的 Skill 与测试工具,旨在降低开源维护门槛并提升代码质量。
Hugging Face 发布 gradio.Server,允许开发者使用 React 等任意前端框架,同时复用 Gradio 的 API 基础设施、并发队列和 ZeroGPU 支持。
推荐理由:原文给出了 gradio.Server 的核心用法,读者可以据此将任意前端与 Gradio 后端结合。
Mistral AI 发布 Spaces CLI,旨在同时服务人类开发者与编码 Agent。该工具通过为所有交互输入提供 Flag 等价物、使用插件系统管理模块、生成 context.json 和 AGENTS.md 提供结构化上下文,以及显式处理状态依赖,实现了 Agent 的端到端自主操作。
推荐理由:Mistral 分享了 Spaces CLI 兼顾人类与 Agent 的设计原则,为开发者工具的可编程性提供了可迁移的方法。
Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。
推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。
NVIDIA 发布一套端到端流水线,可在单张 GPU 上一天内将通用 Embedding 模型微调为领域专用模型。该教程涵盖使用 NeMo Data Designer 生成合成训练数据、硬负样本挖掘、多跳查询处理、模型微调、BEIR 评估以及通过 NVIDIA NIM 部署为 OpenAI 兼容 API 的完整步骤。
推荐理由:提供从文档生成合成数据到模型微调及部署的完整六步流水线,支持单卡快速适配领域检索。
Mistral 发布 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 编码能力整合至单一模型。该模型采用 MoE 架构,拥有 119B 总参数和 256k 上下文窗口,支持可配置的推理强度。相比前代,端到端延迟降低 40%,吞吐量提升 3 倍,并开源 Apache 2.0 许可。
推荐理由:模型统一了推理、多模态与编码能力,提供可配置推理强度,兼顾性能与部署效率。
Hugging Face 调研了16个开源异步强化学习库,从编排、缓冲区、权重同步等七个维度进行对比,并基于此发布了 TRL 异步训练器的设计原则。
推荐理由:文章系统梳理了16个异步RL库的架构差异,为优化推理与训练重叠提供了可迁移的设计参考。
Hugging Face 推出 Storage Buckets,一种基于 Xet 的 S3 风格对象存储,用于高效管理训练检查点等中间产物。该功能支持跨文件去重以节省带宽与成本,提供预冷功能加速多区域读取,并兼容 fsspec 接口。
推荐理由:Hugging Face 推出基于 Xet 的 S3 风格对象存储,提供去重加速与预冷功能,优化 ML 中间产物管理。
Hugging Face发布Ulysses序列并行教程,介绍如何通过DeepSpeed在Accelerate、Transformers Trainer和TRL的SFTTrainer中配置百万级上下文训练。实测显示,在4块H100上使用SP=4可将序列长度扩展至96K,内存降低3.3倍,64K序列下吞吐量提升3.7倍。
推荐理由:文章详细解析了Ulysses序列并行原理,并给出了在Accelerate、Transformers和TRL中启用百万级上下文训练的具体配置与代码。
Photoroom 开源 PRX 项目,展示了在 24 小时和 1500 美元预算内,利用像素空间训练、TREAD 路由、REPA 对齐和 Muon 优化器等技巧,从头训练文本到图像扩散模型的具体工程配方。
推荐理由:原文给出了在24小时和1500美元预算内训练文本到图像模型的具体工程配方,读者可以据此复现并优化自身的扩散模型训练流程。
Hugging Face 重构了 Transformers 库以原生支持 Mixture of Experts (MoE) 架构,引入动态权重加载与专家后端,使 Qwen1.5-110B 等模型加载速度提升数倍,并联合 Unsloth 实现 MoE 训练速度提升约 12 倍。
推荐理由:Hugging Face重构了MoE模型的权重加载与执行后端,显著提升了大参数模型的加载速度与训练效率。
Hugging Face 宣布 GGML 及其 llama.cpp 项目加入,核心维护者 Georgi Gerganov 团队将保持 100% 开源与自治。双方将致力于优化 ggml 软件的用户体验,并实现从 transformers 库到 llama.cpp 的无缝模型部署,为本地推理提供长期可持续的资源支持。
推荐理由:官方宣布核心维护者加入,承诺保持开源自治并优化本地部署体验,为本地AI生态提供长期资源保障。
Hugging Face 发布模型训练 Skill,允许用户通过 Claude Code 或 Codex 等编程智能体,利用 hf jobs CLI 提交任务,使用 Unsloth 在 Hugging Face Jobs 上快速微调 LiquidAI/LFM2.5-1.2B-Instruct 等小模型。
推荐理由:提供了通过编程智能体调用 Hugging Face Jobs 和 Unsloth 进行低成本微调的完整实操路径。
IBM 与 UC Berkeley 发布 MAST 框架,对 IT-Bench 基准中 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 的 310 条 SRE 执行轨迹进行归因分析。研究发现前沿模型多因错误验证失败,而开源模型常因推理与行动不匹配导致级联崩溃,并据此提出针对性的工程修复策略。
推荐理由:文章提出 MAST 框架拆解智能体失败模式,揭示不同模型在验证与终止上的具体缺陷及工程修复路径。
Hugging Face 发布了一个名为 cuda-kernels 的 Agent Skill,指导 Claude 和 Codex 等编码智能体编写生产级 CUDA 内核。
推荐理由:提供了将 CUDA 开发经验封装为 Agent Skill 的完整方案,并给出了在 H100 上针对 LTX-Video 和 Qwen3 的实测加速数据。
Google Research 在 SPAA 2025 发表研究,针对时变容量环境下的非抢占式作业调度问题,提出最大化吞吐量的常数因子近似算法。离线场景中,Greedy 策略在单位利润下实现 1/2-近似,不同利润下实现 1/4-近似。在线场景中,允许重启的 Greedy 变体保持 1/2-竞争比,而禁止重启的严格模型下算法性能受限。
Hugging Face 发布 Transformers.js v4,引入基于 C++ 重写的 WebGPU 运行时,支持在浏览器、Node、Bun 和 Deno 中运行 AI 模型。新增 ModelRegistry API 优化生产环境加载,独立出轻量级 Tokenizers.js 库,并新增 GPT-OSS、Mamba 等模型支持。
推荐理由:引入全新 WebGPU 运行时并支持 Node 端侧运行,显著提升了本地推理性能与部署灵活性。
Google Research 提出 Sequential Attention,通过注意力机制的贪心选择机制解决子集选择难题,使模型更轻量且快速。该方法将选择过程融入单次训练,无需昂贵重训即可实现高效特征选择,并在多个神经网络基准测试中取得最先进结果。
H Company 发布 Holo2-235B-A22B Preview 模型,在 Screenspot-Pro 上取得 78.5% 的 SOTA 成绩。该模型支持 Agentic Localization,通过迭代优化在 3 步内提升精度,实现 10-20% 的相对增益。目前作为研究版在 Hugging Face 提供。
Photoroom 发布 PRX 文本到图像模型训练的第二部分,通过消融实验验证了表征对齐(REPA)、训练目标(对比流匹配、JiT)、Token 路由(TREAD/SPRINT)和数据策略对训练效率的影响。实验表明,REPA 能加速早期收敛,REPA-E 和 FLUX2-AE 能显著提升质量,而 Token 路由在高分辨率下能大幅提升吞吐量并改善质量。
推荐理由:原文通过系统消融实验验证了表征对齐、训练目标、Token路由和数据策略对训练效率的影响,提供了可迁移的优化方法。
Hugging Face 发布 upskill 工具,用于生成和评估智能体技能(Agent Skills)。该工具利用 Claude Opus 4.5 等大模型生成技能文件,并自动创建测试用例以评估技能在较小或本地模型上的性能提升。文章以编写 CUDA 内核为例,展示了如何通过该工具将复杂任务能力从昂贵模型迁移至低成本模型,从而优化 token 消耗并降低使用成本。
推荐理由:提供将专家模型能力转化为智能体技能并评估迁移效果的工具,帮助开发者低成本复用复杂任务能力。
Hugging Face 发布系列文章第二篇,分析中国开源AI生态在“DeepSeek时刻”后的架构与硬件选择。MoE成为默认架构,多模态与智能体并行发展,0.5B-30B小模型因灵活部署受青睐,Apache 2.0许可降低使用门槛。重点转向国产硬件适配,华为昇腾、寒武纪等实现推理零日支持,蚂蚁、百度、智谱等开始使用国产芯片进行训练,标志着竞争从模型性能转向系统设计与生态构建。
LinkedIn 团队分享了在 verl 框架下对 GPT-OSS 进行智能体强化学习训练的实践经验,通过修复 MoE 架构下的对数概率不匹配、在 FlashAttention v3 中实现 Attention Sink 反向传播以及优化 FSDP 内存占用,解决了训练不稳定和显存爆炸问题,实现了模型在数学推理和工具调用任务上的稳定收敛。
推荐理由:文章详细记录了GPT-OSS在 verl 框架下实现智能体强化学习的关键工程修复,为开源模型部署提供了可复用的技术路径。
Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。
推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。
NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。
推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。
llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。
推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。
推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。