在 Transformers.js 中实验拟议的跨域存储 API
拟议的 Cross-Origin Storage API 通过密码学哈希而非 URL 标识文件,旨在解决浏览器中跨域缓存隔离导致的重复下载问题。在 Transformers.js 应用中,不同来源的 Web 应用即使请求相同的模型资源或 Wasm 运行时,也会因 Network Isolation Key 不同而无法共享缓存,造成如 177 MB 的重复存储。
拟议的 Cross-Origin Storage API 通过密码学哈希而非 URL 标识文件,旨在解决浏览器中跨域缓存隔离导致的重复下载问题。在 Transformers.js 应用中,不同来源的 Web 应用即使请求相同的模型资源或 Wasm 运行时,也会因 Network Isolation Key 不同而无法共享缓存,造成如 177 MB 的重复存储。
Hugging Face 开源了 huggingface_hub 的每周自动化发布工作流,利用 GLM-5.2 等开源模型起草发布说明,并通过确定性脚本校验 PR 完整性,人工仅需少量时间审核。该流程结合 GitHub Actions 与 PyPI 可信发布,将发布周期从 4-6 周缩短至每周一次,且成本极低。
推荐理由:提供了一套基于开源模型与确定性校验的自动化发布工作流,可迁移至其他开源项目以大幅降低维护成本。
Hugging Face 分享了在本地硬件上使用 Gemma-4-26b-a4b 和 Qwen3.6-35b-a3b 模型,结合 Agent 框架和受限 Shell 对 GitHub PR 进行实时分类的实践。该方案通过结构化输出实现高吞吐过滤,在 330 行评估集上 Qwen 精确率达 0.831,Gemma 召回率达 0.905。
推荐理由:文章给出了在本地硬件上利用 Agent 框架和受限 Shell 实现高吞吐 PR 分类的完整工程方案与性能数据。
Hugging Face 发布 PyTorch Profiling 系列第二篇,通过对比 nn.Linear 与 MLP 的 Eager、torch.compile 及 Liger 手写内核轨迹,揭示了算子融合、显存优化与编译开销机制。
推荐理由:通过对比Eager、编译与手写内核的Profiler轨迹,揭示了PyTorch底层算子融合机制与显存优化原理。
Hugging Face 发布教程,指导用户通过 huggingface/jobs-actions 桥接工具,将 GitHub Actions 的 CI 任务调度到 Hugging Face Jobs 运行。该方案支持 CPU 和 GPU 硬件,实测 CPU 任务提速约 30%,并显著降低 GPU 测试成本。
推荐理由:提供将 GitHub Actions 接入 Hugging Face Jobs 的完整方案,实现低成本 GPU 测试与更快的 CI 执行。
NVIDIA 发布 Nemotron 3.5 内容安全模型,基于 Gemma 3 4B 微调,支持文本与图像的多模态联合评估及 12 种语言。该模型新增自定义企业策略执行与可审计推理(THINK Mode),并开源了包含真实图像的多模态安全数据集。
推荐理由:Nemotron 3.5 将多模态、多语言与自定义企业策略执行整合于单一模型,提供可审计推理与开源数据集。
Hugging Face转载Dharma AI论文,展示在SFT后引入DPO阶段,利用模型自身的退化输出作为拒绝样本,在五个视觉语言模型家族中平均降低59.4%的文本退化率。
推荐理由:文章验证了DPO在结构化OCR任务中抑制文本退化,为无标注场景下的模型优化提供了可迁移的方法。
JetBrains 发布 Mellum2,一个 12B 参数的 MoE 模型,每 token 仅激活 2.5B 参数,推理速度比同类模型快 2 倍以上。该模型开源并支持 Apache 2.0 协议,适用于路由、RAG、子智能体和私有部署。
推荐理由:原文给出了模型架构和性能数据,读者可以据此评估它在多模型系统中的路由和编排价值。
IBM 通过引入程序分析和知识图谱等智能体逻辑,显著提升了企业级 AI 智能体的性能与成本效益。在遗留代码理解场景中,Mistral Medium 250B 模型配合该逻辑实现约 30 倍更低的 Token 消耗;在测试生成方面,Devstral 24B 模型结合 Aster 库使代码覆盖率提升 20%-45%,Token 消耗降低多达 15 倍。
Hugging Face发布PyTorch Profiler入门教程,通过矩阵运算实例演示了如何解读性能表格与Trace,揭示了编译优化在调度器层面的融合机制及CPU开销增加的原因。
推荐理由:文章通过矩阵运算实例拆解了torch.profiler的表格与Trace解读方法,揭示了编译优化的实际执行路径。
Hugging Face TRL 发布 Delta Weight Sync 功能,利用 bf16 权重在相邻 RL 优化步骤间 99% 不变的稀疏特性,仅上传变更的权重补丁至 Hub Bucket。该方案将 Qwen3-0.6B 的每步传输数据从 1.2 GB 降至 20-35 MB,使训练端与推理端无需共享网络即可通过对象存储异步同步权重。
推荐理由:通过稀疏权重同步将异步RL每步传输量降低两个数量级,实现无需共享集群的分布式训练。
Hugging Face 在 transformers 库中实现了连续批处理的异步优化,通过 CUDA streams 和 events 解耦 CPU 与 GPU 工作流,使 GPU 利用率从 76.0% 提升至 99.4%,生成时间缩短 22%。
推荐理由:文章通过解耦CPU和GPU工作流实现异步批处理,使GPU利用率提升至99.4%,为长文本推理提供了可复用的工程优化方案。
AWS 发布文章解析基础模型训练与推理的开源软件栈与基础设施集成架构。文章涵盖 P5 和 P6 实例系列的 H100、H200、B200 及 B300 GPU 规格,以及 Slurm、Kubernetes、PyTorch 和 Prometheus 等工具在资源管理与可观测性中的应用。
Berkeley AI Research 发布长文综述自适应并行推理(APR),探讨模型如何自主决定何时分解任务、生成多少并发线程及如何协调。文章对比了 Multiverse 修改推理引擎复用 KV Cache 与 ThreadWeaver 保持引擎不变在客户端拼接的方案,并分析了 SFT 演示与基于关键路径长度的奖励设计。
推荐理由:系统梳理了自适应并行推理的范式,对比了修改推理引擎与客户端编排两种执行路径的优劣。
ServiceNow 分享了将推理引擎从 vLLM V0 迁移到 V1 时消除训练推理偏差的实践。通过修复 logprobs 语义、关闭 prefix caching、调整 inflight weight update 路径以及使用 fp32 lm_head,最终使 V1 的训练轨迹与 V0 参考保持一致。
推荐理由:原文拆解了 vLLM V1 迁移中导致训练轨迹偏离的四个关键后端差异,提供了可复用的对齐方案。
DeepInfra 正式成为 Hugging Face Hub 的 Inference Provider,支持 DeepSeek V4、Kimi-K2.6、GLM-5.1 等 100 多款模型。
Hugging Face 展示了基于 OpenAI 开源隐私过滤模型 Privacy Filter 构建的三个 Web 应用:文档隐私探索器、图像匿名化工具和智能文本脱敏服务。该模型支持 128k 上下文,可识别八类个人敏感信息。
推荐理由:Hugging Face 展示了基于 OpenAI Privacy Filter 构建的三个 Web 应用,揭示了其在文档、图像和文本场景中的工程实践。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,通过解耦计算岛实现跨广域网的低带宽、高弹性训练。在 Gemma 4 模型测试中,该系统在硬件故障下保持高可用性与同等基准性能,并在 120 亿参数模型训练中实现比传统方法快 20 倍的速度。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,通过轨迹提升、状态迭代随机化及梯度重塑解决长视界规划难题。该方法将轨迹映射至虚拟状态实现时间并行优化,避免高维视觉模型中的脆弱梯度,使长视界规划更具鲁棒性。
Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。
推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。
Google Research 在 SPAA 2025 发表研究,针对时变容量环境下的非抢占式作业调度问题,提出最大化吞吐量的常数因子近似算法。离线场景中,Greedy 策略在单位利润下实现 1/2-近似,不同利润下实现 1/4-近似。在线场景中,允许重启的 Greedy 变体保持 1/2-竞争比,而禁止重启的严格模型下算法性能受限。
Google Research 提出 Sequential Attention,通过注意力机制的贪心选择机制解决子集选择难题,使模型更轻量且快速。该方法将选择过程融入单次训练,无需昂贵重训即可实现高效特征选择,并在多个神经网络基准测试中取得最先进结果。
LinkedIn 团队分享了在 verl 框架下对 GPT-OSS 进行智能体强化学习训练的实践经验,通过修复 MoE 架构下的对数概率不匹配、在 FlashAttention v3 中实现 Attention Sink 反向传播以及优化 FSDP 内存占用,解决了训练不稳定和显存爆炸问题,实现了模型在数学推理和工具调用任务上的稳定收敛。
推荐理由:文章详细记录了GPT-OSS在 verl 框架下实现智能体强化学习的关键工程修复,为开源模型部署提供了可复用的技术路径。
Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。
推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。
NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。
推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。
llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。
推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。
Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。
推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。
Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。
推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。
本文从注意力机制和 KV 缓存出发,推导了连续批处理技术,旨在通过并行处理多个对话并在完成后进行切换来最大化推理吞吐量。该技术解决了大语言模型在同时服务大量用户时因逐词生成导致的计算开销问题,使响应生成更加高效。
Google Research 发布基于线性回归的轻量级 AI 模型,预测特定充电桩在指定时间后的可用性概率。该模型通过每小时特征权重量化占用率变化,在 30 至 60 分钟预测窗口内,相比“保持当前状态”基线显著提升了准确率。
Hugging Face TRL 官方集成 RapidFire AI,通过自适应分块调度与并发训练机制,实现多配置微调加速 16-20 倍。提供实时仪表盘与 IC Ops 功能,支持在训练中途停止低效配置或克隆优化参数,无需重启任务。
推荐理由:官方集成提供并发微调与实时干预能力,可显著降低多配置对比的时间与算力成本。
Google 发布 Project Suncatcher 研究,提出由搭载 Google TPUs 的太阳能卫星组成的星座,通过自由空间光链路连接以构建可扩展的太空 AI 基础设施。早期实验验证了单对收发器可实现 800 Gbps 传输,Trillium v6e Cloud TPU 在辐射测试中表现稳健,预计 2030 年代中期发射成本将降至 200 美元/kg 以下。
Hugging Face发布深度分析,指出美国出口管制反而加速了中国国产芯片与开源模型的协同创新。DeepSeek、Qwen等模型通过架构优化降低推理成本,并率先适配华为昇腾等国产硬件。这种“非NVIDIA优先”策略正在催生独立于CUDA的软件生态,推动全球AI基础设施向多极化演变。
推荐理由:文章梳理了美国出口管制如何倒逼中国加速国产芯片与开源模型协同创新,揭示了全球AI算力格局的重构路径。
Google Cloud C4 虚拟机配合 Intel Xeon 6 处理器,使 OpenAI GPT OSS 大语言模型的推理总拥有成本(TCO)较上一代 C3 虚拟机降低 70%。该配置在吞吐量方面实现 1.4 倍至 1.7 倍提升,且每小时价格更低。
Arm 将出席 PyTorch 大会,展示如何利用 PyTorch 和 ExecuTorch 赋能开发者构建和部署 AI 应用。现场将演示 vLLM、Mixture of Experts 及 ExecuTorch 在云、移动端和边缘侧的最新优化用例,并提供关于 Yellow Teaming 等负责任 AI 实践的个性化工作坊。
Hugging Face 博客展示了在 Intel Core Ultra 上利用 OpenVINO.GenAI 加速 Qwen3-8B 的方法。通过剪枝 Qwen3-0.6B 草稿模型并配合推测解码,推理速度提升约 1.4 倍,并结合 smolagents 实现了高效的本地 AI Agent。
Scaleway 正式成为 Hugging Face Hub 支持的 Inference Provider,支持 gpt-oss、Qwen3、DeepSeek R1 和 Gemma 3 等模型。
Hugging Face 升级 transformers 库以支持 OpenAI GPT-OSS 系列模型,新增 MXFP4 量化、张量并行、专家并行及动态滑动窗口缓存等部署优化。通过 Hub 下载预编译内核,显著降低显存占用并提升推理效率。
推荐理由:Hugging Face 为 GPT-OSS 提供开箱即用的部署支持,涵盖 MXFP4 量化与多卡并行,为社区提供了可复用的工程参考。
Together AI 宣布与 Hugging Face 集成,允许开发者通过 API 直接微调 Hugging Face Hub 上的兼容模型。用户只需指定基础模型配置和 HF 模型,即可利用 Together 基础设施完成训练,并可将结果推回 Hub。
推荐理由:Together AI 打通 Hugging Face Hub 实现一键微调,降低开发门槛并加速模型迭代。
Hugging Face 发布教程,展示如何在 ZeroGPU Spaces 中利用 PyTorch 提前编译(AoT)技术加速图像和视频生成。通过结合 FP8 量化、动态形状处理和 FlashAttention-3,FLUX.1-dev 等模型可获得 1.3 至 1.8 倍的速度提升。
推荐理由:原文给出了在ZeroGPU上结合AoT编译与量化加速的具体代码,读者可直接复用以优化生成类应用。