跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 61–68 条 · 共 68 条
12月5日周五
  1. Google Research68

    Google Research 发布 Titans 架构与 MIRAS 框架实现 AI 长期记忆

    Google Research 发布 Titans 架构与 MIRAS 理论框架,利用深度神经网络作为记忆模块实现 AI 的长期记忆。该架构在 BABILong 等基准测试中超越 Transformer++ 和 Mamba-2,支持超过 200 万 token 的上下文窗口,同时保持线性推理速度。

    推荐理由:提出结合RNN速度与Transformer精度的新架构,通过深度记忆模块实现超长上下文的高效推理。

12月1日周一
  1. Hugging Face Blog72

    Hugging Face Transformers v5 发布:确立 PyTorch 单后端与模块化设计

    Hugging Face 发布 Transformers v5.0.0rc-0,确立 PyTorch 为唯一后端,引入模块化设计与注意力接口抽象。v5 全面强化预训练、推理与量化支持,新增 transformers serve 系统,并深度打通 vLLM、SGLang、llama.cpp 等生态工具链。

    推荐理由:v5 确立了 PyTorch 单后端与模块化设计,全面打通训练推理部署链路,为生态互操作提供统一标准。

11月21日周五
  1. Hugging Face Blog70

    Hugging Face TRL 官方集成 RapidFire AI 实现 20 倍加速微调

    Hugging Face TRL 官方集成 RapidFire AI,通过自适应分块调度与并发训练机制,实现多配置微调加速 16-20 倍。提供实时仪表盘与 IC Ops 功能,支持在训练中途停止低效配置或克隆优化参数,无需重启任务。

    推荐理由:官方集成提供并发微调与实时干预能力,可显著降低多配置对比的时间与算力成本。

10月29日周三
  1. Hugging Face Blog81

    Hugging Face:美国出口管制如何重塑全球AI算力与开源格局

    Hugging Face发布深度分析,指出美国出口管制反而加速了中国国产芯片与开源模型的协同创新。DeepSeek、Qwen等模型通过架构优化降低推理成本,并率先适配华为昇腾等国产硬件。这种“非NVIDIA优先”策略正在催生独立于CUDA的软件生态,推动全球AI基础设施向多极化演变。

    推荐理由:文章梳理了美国出口管制如何倒逼中国加速国产芯片与开源模型协同创新,揭示了全球AI算力格局的重构路径。

9月11日周四
  1. Hugging Face Blog76

    Hugging Face transformers 升级支持 GPT-OSS 及多项部署优化

    Hugging Face 升级 transformers 库以支持 OpenAI GPT-OSS 系列模型,新增 MXFP4 量化、张量并行、专家并行及动态滑动窗口缓存等部署优化。通过 Hub 下载预编译内核,显著降低显存占用并提升推理效率。

    推荐理由:Hugging Face 为 GPT-OSS 提供开箱即用的部署支持,涵盖 MXFP4 量化与多卡并行,为社区提供了可复用的工程参考。

  2. Hugging Face Blog65

    Together AI 支持在 Hugging Face Hub 上直接微调模型

    Together AI 宣布与 Hugging Face 集成,允许开发者通过 API 直接微调 Hugging Face Hub 上的兼容模型。用户只需指定基础模型配置和 HF 模型,即可利用 Together 基础设施完成训练,并可将结果推回 Hub。

    推荐理由:Together AI 打通 Hugging Face Hub 实现一键微调,降低开发门槛并加速模型迭代。

9月2日周二
  1. Hugging Face Blog72

    Hugging Face 教程:在 ZeroGPU Spaces 中使用 PyTorch 提前编译加速

    Hugging Face 发布教程,展示如何在 ZeroGPU Spaces 中利用 PyTorch 提前编译(AoT)技术加速图像和视频生成。通过结合 FP8 量化、动态形状处理和 FlashAttention-3,FLUX.1-dev 等模型可获得 1.3 至 1.8 倍的速度提升。

    推荐理由:原文给出了在ZeroGPU上结合AoT编译与量化加速的具体代码,读者可直接复用以优化生成类应用。

8月18日周一
  1. Hugging Face Blog68

    从零构建生产级CUDA内核:PyTorch原生算子开发与Hub分发指南

    Hugging Face发布kernel-builder教程,指导开发者从零构建生产级CUDA内核。通过build.toml和flake.nix实现环境隔离与多架构编译,将内核注册为PyTorch原生算子以兼容torch.compile,并支持通过Hub进行版本管理与分发。

    推荐理由:文章提供从零构建可复用PyTorch CUDA内核的完整工程指南,涵盖构建、版本控制与Hub分发。