跳到正文

#部署/工程

今日 4 条
5月27日周三
  1. Mistral AI70

    Mistral 收购 Emmi AI 推出物理 AI 能力

    Mistral 宣布收购 Emmi AI,推出物理 AI 能力,将传统仿真从小时级加速至秒级。该能力作为 Mistral 企业平台的一部分,支持航空航天、汽车、半导体等领域的工程设计加速与实时数字孪生。

    推荐理由:Mistral 收购 Emmi AI 推出物理 AI 能力,将仿真速度从小时级提升至秒级,为工业工程设计加速提供新方案。

  2. Hugging Face Blog84

    TRL 发布 Delta Weight Sync:通过 Hub Bucket 实现稀疏权重同步

    Hugging Face TRL 发布 Delta Weight Sync 功能,利用 bf16 权重在相邻 RL 优化步骤间 99% 不变的稀疏特性,仅上传变更的权重补丁至 Hub Bucket。该方案将 Qwen3-0.6B 的每步传输数据从 1.2 GB 降至 20-35 MB,使训练端与推理端无需共享网络即可通过对象存储异步同步权重。

    推荐理由:通过稀疏权重同步将异步RL每步传输量降低两个数量级,实现无需共享集群的分布式训练。

5月22日周五
  1. Mistral AI70

    Mistral Studio 发布 Connectors 功能,支持内置与自定义 MCP 集成

    Mistral AI 在 Studio 中发布 Connectors 功能,允许开发者通过 API/SDK 使用内置连接器及自定义 MCP 协议工具。该功能支持直接工具调用、人工审批流程及跨应用复用,旨在简化企业级 AI 应用的集成与治理。

    推荐理由:官方发布 Connectors 功能,支持内置与自定义 MCP 集成,提供工具调用与人工审批能力。

5月14日周四
  1. Hugging Face Blog82

    Hugging Face 实现连续批处理的异步优化方案

    Hugging Face 在 transformers 库中实现了连续批处理的异步优化,通过 CUDA streams 和 events 解耦 CPU 与 GPU 工作流,使 GPU 利用率从 76.0% 提升至 99.4%,生成时间缩短 22%。

    推荐理由:文章通过解耦CPU和GPU工作流实现异步批处理,使GPU利用率提升至99.4%,为长文本推理提供了可复用的工程优化方案。

5月12日周二
5月8日周五
  1. Berkeley AI Research68

    自适应并行推理:高效推理扩展的新范式

    Berkeley AI Research 发布长文综述自适应并行推理(APR),探讨模型如何自主决定何时分解任务、生成多少并发线程及如何协调。文章对比了 Multiverse 修改推理引擎复用 KV Cache 与 ThreadWeaver 保持引擎不变在客户端拼接的方案,并分析了 SFT 演示与基于关键路径长度的奖励设计。

    推荐理由:系统梳理了自适应并行推理的范式,对比了修改推理引擎与客户端编排两种执行路径的优劣。

5月7日周四
  1. Hugging Face Blog70

    ServiceNow 分享 vLLM V0 到 V1 迁移中消除训练推理偏差的实践

    ServiceNow 分享了将推理引擎从 vLLM V0 迁移到 V1 时消除训练推理偏差的实践。通过修复 logprobs 语义、关闭 prefix caching、调整 inflight weight update 路径以及使用 fp32 lm_head,最终使 V1 的训练轨迹与 V0 参考保持一致。

    推荐理由:原文拆解了 vLLM V1 迁移中导致训练轨迹偏离的四个关键后端差异,提供了可复用的对齐方案。

4月29日周三
4月27日周一
  1. Hugging Face Blog80

    Hugging Face 展示基于 OpenAI Privacy Filter 构建的三个 Web 应用

    Hugging Face 展示了基于 OpenAI 开源隐私过滤模型 Privacy Filter 构建的三个 Web 应用:文档隐私探索器、图像匿名化工具和智能文本脱敏服务。该模型支持 128k 上下文,可识别八类个人敏感信息。

    推荐理由:Hugging Face 展示了基于 OpenAI Privacy Filter 构建的三个 Web 应用,揭示了其在文档、图像和文本场景中的工程实践。

4月23日周四
  1. Hugging Face Blog67

    在 Chrome 扩展中使用 Transformers.js 构建本地 AI 助手

    Hugging Face 发布教程,展示如何在 Manifest V3 约束下使用 Transformers.js 构建 Chrome 扩展。文章以 Gemma 4 为例,详解了后台服务工作者托管模型、侧边栏 UI 与内容脚本的通信架构,以及本地工具调用与数据持久化实现。

    推荐理由:原文拆解了基于 Manifest V3 的 Chrome 扩展架构,展示了如何在后台服务工作者中托管本地模型并实现工具调用。

4月22日周三
4月20日周一
4月16日周四
  1. Hugging Face Blog79

    Hugging Face 开源移植 transformers 到 mlx-lm 的 Skill 与测试工具

    Hugging Face 发布了一个 Skill 和测试工具,帮助开发者将语言模型从 transformers 快速移植到 mlx-lm。该 Skill 可自动处理环境配置、代码转换及数值比对,并生成包含详细报告的 PR。配套的独立测试工具用于验证结果,旨在缓解 Agent 时代开源维护者面临的 PR 激增压力。

    推荐理由:Hugging Face 开源了将模型从 transformers 移植到 mlx-lm 的 Skill 与测试工具,旨在降低开源维护门槛并提升代码质量。

4月1日周三
3月31日周二
  1. Mistral AI70

    Mistral AI 发布 Spaces CLI:兼顾人类与 Agent 的开发者工具

    Mistral AI 发布 Spaces CLI,旨在同时服务人类开发者与编码 Agent。该工具通过为所有交互输入提供 Flag 等价物、使用插件系统管理模块、生成 context.json 和 AGENTS.md 提供结构化上下文,以及显式处理状态依赖,实现了 Agent 的端到端自主操作。

    推荐理由:Mistral 分享了 Spaces CLI 兼顾人类与 Agent 的设计原则,为开发者工具的可编程性提供了可迁移的方法。

  2. Google Research68

    Google Research 发布论文估算量子计算机破解加密货币的量子资源

    Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。

    推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。

3月21日周六
  1. Hugging Face Blog76

    NVIDIA 发布单卡一天内微调领域专用 Embedding 模型的完整教程

    NVIDIA 发布一套端到端流水线,可在单张 GPU 上一天内将通用 Embedding 模型微调为领域专用模型。该教程涵盖使用 NeMo Data Designer 生成合成训练数据、硬负样本挖掘、多跳查询处理、模型微调、BEIR 评估以及通过 NVIDIA NIM 部署为 OpenAI 兼容 API 的完整步骤。

    推荐理由:提供从文档生成合成数据到模型微调及部署的完整六步流水线,支持单卡快速适配领域检索。

3月17日周二
  1. Mistral AI88

    Mistral 发布 Mistral Small 4 统一模型

    Mistral 发布 Mistral Small 4,将 Magistral 推理、Pixtral 多模态和 Devstral 编码能力整合至单一模型。该模型采用 MoE 架构,拥有 119B 总参数和 256k 上下文窗口,支持可配置的推理强度。相比前代,端到端延迟降低 40%,吞吐量提升 3 倍,并开源 Apache 2.0 许可。

    推荐理由:模型统一了推理、多模态与编码能力,提供可配置推理强度,兼顾性能与部署效率。

3月10日周二
  1. Hugging Face Blog75

    Hugging Face Hub 推出 Storage Buckets 对象存储功能

    Hugging Face 推出 Storage Buckets,一种基于 Xet 的 S3 风格对象存储,用于高效管理训练检查点等中间产物。该功能支持跨文件去重以节省带宽与成本,提供预冷功能加速多区域读取,并兼容 fsspec 接口。

    推荐理由:Hugging Face 推出基于 Xet 的 S3 风格对象存储,提供去重加速与预冷功能,优化 ML 中间产物管理。

3月9日周一
  1. Hugging Face Blog75

    Ulysses Sequence Parallelism:支持百万级上下文训练的教程

    Hugging Face发布Ulysses序列并行教程,介绍如何通过DeepSpeed在Accelerate、Transformers Trainer和TRL的SFTTrainer中配置百万级上下文训练。实测显示,在4块H100上使用SP=4可将序列长度扩展至96K,内存降低3.3倍,64K序列下吞吐量提升3.7倍。

    推荐理由:文章详细解析了Ulysses序列并行原理,并给出了在Accelerate、Transformers和TRL中启用百万级上下文训练的具体配置与代码。

3月4日周三
  1. Hugging Face Blog75

    Photoroom 发布 PRX 开源项目:24小时训练文本到图像模型

    Photoroom 开源 PRX 项目,展示了在 24 小时和 1500 美元预算内,利用像素空间训练、TREAD 路由、REPA 对齐和 Muon 优化器等技巧,从头训练文本到图像扩散模型的具体工程配方。

    推荐理由:原文给出了在24小时和1500美元预算内训练文本到图像模型的具体工程配方,读者可以据此复现并优化自身的扩散模型训练流程。

2月26日周四
  1. Hugging Face Blog75

    Hugging Face Transformers 重构 MoE 权重加载与执行后端

    Hugging Face 重构了 Transformers 库以原生支持 Mixture of Experts (MoE) 架构,引入动态权重加载与专家后端,使 Qwen1.5-110B 等模型加载速度提升数倍,并联合 Unsloth 实现 MoE 训练速度提升约 12 倍。

    推荐理由:Hugging Face重构了MoE模型的权重加载与执行后端,显著提升了大参数模型的加载速度与训练效率。

2月20日周五
  1. Hugging Face Blog78

    GGML 与 llama.cpp 加入 Hugging Face 以推动 Local AI 长期发展

    Hugging Face 宣布 GGML 及其 llama.cpp 项目加入,核心维护者 Georgi Gerganov 团队将保持 100% 开源与自治。双方将致力于优化 ggml 软件的用户体验,并实现从 transformers 库到 llama.cpp 的无缝模型部署,为本地推理提供长期可持续的资源支持。

    推荐理由:官方宣布核心维护者加入,承诺保持开源自治并优化本地部署体验,为本地AI生态提供长期资源保障。

  2. Hugging Face Blog75

    使用编程智能体配合 Unsloth 和 Hugging Face Jobs 免费微调模型

    Hugging Face 发布模型训练 Skill,允许用户通过 Claude Code 或 Codex 等编程智能体,利用 hf jobs CLI 提交任务,使用 Unsloth 在 Hugging Face Jobs 上快速微调 LiquidAI/LFM2.5-1.2B-Instruct 等小模型。

    推荐理由:提供了通过编程智能体调用 Hugging Face Jobs 和 Unsloth 进行低成本微调的完整实操路径。

2月19日周四
  1. Hugging Face Blog78

    IBM 与 UC Berkeley 发布 MAST 框架诊断 IT-Bench 智能体失败原因

    IBM 与 UC Berkeley 发布 MAST 框架,对 IT-Bench 基准中 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 的 310 条 SRE 执行轨迹进行归因分析。研究发现前沿模型多因错误验证失败,而开源模型常因推理与行动不匹配导致级联崩溃,并据此提出针对性的工程修复策略。

    推荐理由:文章提出 MAST 框架拆解智能体失败模式,揭示不同模型在验证与终止上的具体缺陷及工程修复路径。

2月13日周五
2月11日周三
  1. Google Research15

    时变容量下非抢占式调度最大化吞吐量研究

    Google Research 在 SPAA 2025 发表研究,针对时变容量环境下的非抢占式作业调度问题,提出最大化吞吐量的常数因子近似算法。离线场景中,Greedy 策略在单位利润下实现 1/2-近似,不同利润下实现 1/4-近似。在线场景中,允许重启的 Greedy 变体保持 1/2-竞争比,而禁止重启的严格模型下算法性能受限。

2月9日周一
  1. Hugging Face Blog78

    Transformers.js v4 发布,支持 WebGPU 与 Node 端侧运行

    Hugging Face 发布 Transformers.js v4,引入基于 C++ 重写的 WebGPU 运行时,支持在浏览器、Node、Bun 和 Deno 中运行 AI 模型。新增 ModelRegistry API 优化生产环境加载,独立出轻量级 Tokenizers.js 库,并新增 GPT-OSS、Mamba 等模型支持。

    推荐理由:引入全新 WebGPU 运行时并支持 Node 端侧运行,显著提升了本地推理性能与部署灵活性。

2月4日周三
2月3日周二
  1. Hugging Face Blog68

    Photoroom PRX 训练设计:从表征对齐到 Token 路由的消融实验

    Photoroom 发布 PRX 文本到图像模型训练的第二部分,通过消融实验验证了表征对齐(REPA)、训练目标(对比流匹配、JiT)、Token 路由(TREAD/SPRINT)和数据策略对训练效率的影响。实验表明,REPA 能加速早期收敛,REPA-E 和 FLUX2-AE 能显著提升质量,而 Token 路由在高分辨率下能大幅提升吞吐量并改善质量。

    推荐理由:原文通过系统消融实验验证了表征对齐、训练目标、Token路由和数据策略对训练效率的影响,提供了可迁移的优化方法。

1月28日周三
  1. Hugging Face Blog78

    Hugging Face 发布 upskill 工具,实现智能体技能生成与跨模型评估

    Hugging Face 发布 upskill 工具,用于生成和评估智能体技能(Agent Skills)。该工具利用 Claude Opus 4.5 等大模型生成技能文件,并自动创建测试用例以评估技能在较小或本地模型上的性能提升。文章以编写 CUDA 内核为例,展示了如何通过该工具将复杂任务能力从昂贵模型迁移至低成本模型,从而优化 token 消耗并降低使用成本。

    推荐理由:提供将专家模型能力转化为智能体技能并评估迁移效果的工具,帮助开发者低成本复用复杂任务能力。

1月27日周二
  1. Hugging Face Blog53

    Hugging Face 分析中国开源AI生态:从模型性能到系统生态的竞争转向

    Hugging Face 发布系列文章第二篇,分析中国开源AI生态在“DeepSeek时刻”后的架构与硬件选择。MoE成为默认架构,多模态与智能体并行发展,0.5B-30B小模型因灵活部署受青睐,Apache 2.0许可降低使用门槛。重点转向国产硬件适配,华为昇腾、寒武纪等实现推理零日支持,蚂蚁、百度、智谱等开始使用国产芯片进行训练,标志着竞争从模型性能转向系统设计与生态构建。

  2. Hugging Face Blog62

    GPT-OSS 智能体强化学习训练的工程实践与修复

    LinkedIn 团队分享了在 verl 框架下对 GPT-OSS 进行智能体强化学习训练的实践经验,通过修复 MoE 架构下的对数概率不匹配、在 FlashAttention v3 中实现 Attention Sink 反向传播以及优化 FSDP 内存占用,解决了训练不稳定和显存爆炸问题,实现了模型在数学推理和工具调用任务上的稳定收敛。

    推荐理由:文章详细记录了GPT-OSS在 verl 框架下实现智能体强化学习的关键工程修复,为开源模型部署提供了可复用的技术路径。

12月18日周四
  1. Hugging Face Blog68

    Transformers v5 重构分词器:架构与词表分离,支持从零训练

    Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。

    推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。

12月17日周三
  1. Hugging Face Blog70

    使用 NeMo Evaluator 复现 NVIDIA Nemotron 3 Nano 评测

    NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。

    推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。

12月11日周四
  1. Hugging Face Blog70

    llama.cpp 新增 Router 模式支持多模型动态管理

    llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。

    推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。

12月5日周五
  1. Google Research68

    Google Research 发布 Titans 架构与 MIRAS 框架实现 AI 长期记忆

    Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。

    推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。

12月1日周一
  1. Hugging Face Blog72

    Hugging Face Transformers v5 发布:确立 PyTorch 单后端与模块化设计

    Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。

    推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。