跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

109条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 81–100 条 · 共 109 条
9月2日周二
  1. Hugging Face Blog72

    Hugging Face 教程:在 ZeroGPU Spaces 中使用 PyTorch 提前编译加速

    Hugging Face 发布教程,展示如何在 ZeroGPU Spaces 中利用 PyTorch 提前编译(AoT)技术加速图像和视频生成。通过结合 FP8 量化、动态形状处理和 FlashAttention-3,FLUX.1-dev 等模型可获得 1.3 至 1.8 倍的速度提升。

    推荐理由:原文给出了在ZeroGPU上结合AoT编译与量化加速的具体代码,读者可直接复用以优化生成类应用。

8月18日周一
  1. Hugging Face Blog68

    从零构建生产级CUDA内核:PyTorch原生算子开发与Hub分发指南

    Hugging Face发布kernel-builder教程,指导开发者从零构建生产级CUDA内核。通过build.toml和flake.nix实现环境隔离与多架构编译,将内核注册为PyTorch原生算子以兼容torch.compile,并支持通过Hub进行版本管理与分发。

    推荐理由:文章提供从零构建可复用PyTorch CUDA内核的完整工程指南,涵盖构建、版本控制与Hub分发。

8月8日周五
8月7日周四
  1. Hugging Face Blog75

    TRL 新增 MPO、GRPO 等视觉语言模型对齐算法及 vLLM 集成

    Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。

    推荐理由:TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。

8月5日周二
  1. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

7月23日周三
7月22日周二
  1. Hugging Face Blog65

    NVIDIA NIM 支持一键部署 Hugging Face 上的 10 万+ LLM

    NVIDIA 宣布 NIM 推理微服务现支持在 Hugging Face 上快速部署超过 10 万个大语言模型。NIM 提供单一 Docker 容器,自动识别模型格式并选择 TensorRT-LLM、vLLM 或 SGLang 后端,无需手动配置即可实现高性能部署。

    推荐理由:NVIDIA NIM 提供统一容器自动适配 Hugging Face 模型,简化了部署流程。

7月15日周二
  1. Hugging Face Blog72

    Hugging Face 宣布全面迁移至 Xet 存储系统

    Hugging Face 宣布将 Hub 全面迁移至 Xet 存储系统,目前已有超 100 万用户和 50 万个仓库使用。Xet 将成为新用户的默认存储,旧仓库将自动迁移,同时 Hugging Face 计划开源 Xet 协议及底层基础设施。

    推荐理由:Hugging Face 宣布全面迁移至 Xet 存储,通过底层架构升级实现 PB 级数据的高效传输与无缝兼容。

4月9日周三
  1. Mistral AI61

    Mistral 发布基于 RAG Triad 的 LLM 评估教程

    Mistral 发布教程,介绍利用结构化输出功能实现 LLM as a Judge 来评估 RAG 系统。该方案基于 RAG Triad 框架,从上下文相关性、事实依据性和答案相关性三个维度进行量化评分,并提供了完整的 Pydantic 代码实现。

    推荐理由:提供基于RAG Triad的LLM评估框架与结构化输出代码,可直接复用于构建自动化评测流程。

2月12日周三
  1. Hugging Face Blog65

    Hugging Face 开源 Xet 技术加速 Hub 上传下载

    Hugging Face 开源 xet-core 和 hf_xet,通过内容定义分块与块聚合技术加速 Hub 上的文件传输。该技术将分块聚合成最大 64MB 的块,显著减少网络请求和存储开销,实测上传速度提升近 2 倍。

    推荐理由:通过引入块聚合机制优化上传下载速度,为处理大型模型仓库提供了可复用的工程实践。

1月27日周一
1月16日周四
  1. Hugging Face Blog70

    TGI 引入多后端支持,统一 vLLM 与 TensorRT-LLM 部署

    Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。

    推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。

12月24日周二
  1. Hugging Face Blog68

    PyTorch 训练时 GPU 显存可视化与估算方法

    Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。

    推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。

12月23日周一
11月20日周三
  1. Hugging Face Blog70

    Hugging Face 开源 LayerSkip 自推测解码方法与模型

    Hugging Face 发布 LayerSkip 技术,通过早期退出机制实现自推测解码,利用同一模型的不同层完成草稿生成与验证,显著降低显存占用并提升推理速度。官方同步开源了基于 Llama 系列的 LayerSkip 模型权重,并在 transformers 库中支持通过 assistant_early_exit 参数直接调用。

    推荐理由:Hugging Face 官方开源了 LayerSkip 训练方法与模型,提供了在 transformers 中一键开启自推测解码的接口。

10月29日周二
  1. Hugging Face Blog78

    Universal Assisted Generation:跨模型加速推理方法

    Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。

    推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。

10月22日周二
10月8日周二
  1. Hugging Face Blog75

    Hugging Face Transformers 4.45.0 默认启用动态推测解码

    Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。

    推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。

9月18日周三
8月21日周三
  1. Hugging Face Blog68

    Hugging Face 发布 DataCollatorWithFlattening 实现 Flash Attention 2 无填充训练

    Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。

    推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。