跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

121条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–120 条 · 共 121 条
3月20日周四
  1. Hugging Face Blog72

    如何在本地使用 OlympicCoder 进行编码

    LM Studio 发布教程,指导用户将 OlympicCoder 7B 模型通过 LM Studio 和 VS Code 插件接入本地环境。该模型基于 CodeForces-CoTs 数据集优化,适合解决高难度编程挑战,评测显示其 7B 参数版本在 LiveCodeBench 上优于 Claude 3.7 Sonnet 和 GPT-4o。

    推荐理由:原文给出了将开源模型接入本地 IDE 的具体配置步骤,读者可据此搭建私有编码助手。

2月12日周三
  1. Hugging Face Blog65

    Hugging Face 开源 Xet 技术加速 Hub 上传下载

    Hugging Face 开源 xet-core 和 hf_xet,通过内容定义分块与块聚合技术加速 Hub 上的文件传输。该技术将分块聚合成最大 64MB 的块,显著减少网络请求和存储开销,实测上传速度提升近 2 倍。

    推荐理由:通过引入块聚合机制优化上传下载速度,为处理大型模型仓库提供了可复用的工程实践。

1月27日周一
1月16日周四
  1. Hugging Face Blog70

    TGI 引入多后端支持,统一 vLLM 与 TensorRT-LLM 部署

    Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。

    推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。

12月24日周二
  1. Hugging Face Blog68

    PyTorch 训练时 GPU 显存可视化与估算方法

    Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。

    推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。

12月23日周一
11月20日周三
  1. Hugging Face Blog70

    Hugging Face 开源 LayerSkip 自推测解码方法与模型

    Hugging Face 发布 LayerSkip 技术,通过早期退出机制实现自推测解码,利用同一模型的不同层完成草稿生成与验证,显著降低显存占用并提升推理速度。官方同步开源了基于 Llama 系列的 LayerSkip 模型权重,并在 transformers 库中支持通过 assistant_early_exit 参数直接调用。

    推荐理由:Hugging Face 官方开源了 LayerSkip 训练方法与模型,提供了在 transformers 中一键开启自推测解码的接口。

10月29日周二
  1. Hugging Face Blog78

    Universal Assisted Generation:跨模型加速推理方法

    Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。

    推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。

10月22日周二
10月8日周二
  1. Hugging Face Blog75

    Hugging Face Transformers 4.45.0 默认启用动态推测解码

    Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。

    推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。

9月18日周三
8月21日周三
  1. Hugging Face Blog68

    Hugging Face 发布 DataCollatorWithFlattening 实现 Flash Attention 2 无填充训练

    Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。

    推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。

8月12日周一
  1. Hugging Face Blog73

    Hugging Face 推出统一工具调用 API 与工程实践

    Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。

    推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。

6月5日周三
  1. Mistral AI68

    Mistral 推出模型微调服务与开源 SDK

    Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。

    推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

5月23日周二
  1. Hugging Face Blog65

    Safetensors 通过安全审计并将在 Transformers 中成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。

    推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。

4月5日周三
  1. Hugging Face Blog65

    StackLLaMA:手把手教你用RLHF微调LLaMA模型

    Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。

    推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。

3月9日周四
11月2日周三