跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

199条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 181–199 条 · 共 199 条
10月24日周二
  1. Hugging Face Blog75

    Hugging Face 复现 OpenAI 原始 RLHF 代码的 N 个实现细节

    Hugging Face 博客复现了 OpenAI 2019 年 RLHF 代码库,在风格化任务中匹配了原始学习曲线,并整理了包括奖励模型初始化、位置索引处理、拒绝采样、KL 惩罚及 PyTorch 与 TensorFlow Adam 优化器差异在内的关键实现细节。

    推荐理由:文章复现了 OpenAI 原始 RLHF 代码并整理出关键实现细节,为复现 PPO 训练提供了可迁移的工程参考。

10月19日周四
  1. Hugging Face Blog70

    Gradio-Lite 发布:无需服务器的浏览器端 Gradio 运行方案

    Hugging Face 发布 Gradio-Lite,利用 Pyodide 将 Gradio 应用直接运行在浏览器中,无需服务器基础设施。该方案支持多文件和额外依赖安装,具备低延迟和隐私安全优势,但首次加载需 5-15 秒且依赖包兼容性受限。

    推荐理由:Gradio-Lite 将应用运行移至浏览器端,免去了服务器部署成本,适合快速分享和隐私保护场景。

9月12日周二
  1. Hugging Face Blog72

    Transformers 原生量化方案对比:bitsandbytes 与 GPTQ

    Hugging Face 博客对比了 Transformers 中 bitsandbytes 与 auto-gptq 两种原生量化方案。GPTQ 在文本生成推理速度上显著优于 bitsandbytes,而 bitsandbytes 在微调适配器时速度更快且支持跨模态。文章建议先使用 bitsandbytes 进行零样本量化并微调适配器,再使用 GPTQ 量化合并后的模型以部署。

    推荐理由:通过实测对比 bitsandbytes 与 GPTQ 在推理与微调中的性能差异,提供量化方案选型与混合使用策略。

8月23日周三
  1. Hugging Face Blog70

    Transformers 原生集成 AutoGPTQ 支持模型量化

    Hugging Face 在 Transformers 中原生集成 AutoGPTQ 库,支持使用 GPTQ 算法将大语言模型量化至 8、4、3 或 2-bit 精度。该集成兼容 Nvidia 和 AMD 显卡,4-bit 量化下精度损失极小,推理速度接近 fp16 基线,并支持通过 PEFT 对量化模型进行微调。

    推荐理由:原生集成让量化部署更便捷,显著降低显存占用且保持推理速度。

8月22日周二
  1. Hugging Face Blog65

    Hugging Face 发布企业级代码助手 SafeCoder

    Hugging Face 发布 SafeCoder,一款面向企业的全栈代码助手解决方案,支持在客户自有基础设施上自托管部署。该方案基于 StarCoder 模型,提供从数据准备、微调训练到硬件加速推理的完整容器化流程,确保代码数据不出 VPC,并支持 VMware 等主流云及本地环境。

    推荐理由:提供企业级私有化代码助手方案,通过自托管和合规训练解决代码安全与隐私顾虑。

7月5日周三
  1. Hugging Face Blog75

    使用 Transformers.js 在浏览器中构建 ML 驱动的 Web 游戏

    Hugging Face 发布教程,展示如何使用 Transformers.js 和 MobileViT 模型在浏览器中构建实时绘图识别游戏 Doodle Dash。文章涵盖模型微调、ONNX 转换、Web Worker 推理及游戏逻辑实现,并提供了完整源码。

    推荐理由:原文提供了在浏览器端部署MobileViT模型并构建实时绘图识别游戏的完整代码与流程。

5月24日周三
  1. Hugging Face Blog88

    Hugging Face 整合 4-bit 量化与 QLoRA 技术

    Hugging Face 在 transformers 中整合了 bitsandbytes 的 4-bit 量化与 QLoRA 技术,支持在消费级 GPU 上运行和微调大模型。QLoRA 通过 4-bit NormalFloat 存储和双重量化降低显存占用,使单卡微调 65B 参数模型成为可能。

    推荐理由:官方整合了4-bit量化与QLoRA技术,提供了在消费级硬件上运行和微调大模型的完整工具链。

5月23日周二
  1. Hugging Face Blog65

    Safetensors 通过安全审计并将在 Transformers 中成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。

    推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。

4月5日周三
  1. Hugging Face Blog65

    StackLLaMA:手把手教你用RLHF微调LLaMA模型

    Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。

    推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。

3月9日周四
11月2日周三
10月14日周五
  1. Hugging Face Blog61

    Hugging Face 发布 Inference Endpoints 托管推理服务

    Hugging Face 发布 Inference Endpoints,允许用户通过几步操作将模型从 Hub 直接部署到 AWS 等云厂商的托管基础设施。服务支持 Public、Protected 和 Private 三种安全模式,其中 Private 模式可通过 AWS PrivateLink 实现 VPC 内网访问,并提供自动扩缩容、监控日志和 API 调用能力。

    推荐理由:官方发布托管推理服务,提供从公开到私有VPC的多级安全部署选项,降低生产环境部署门槛。

9月27日周二
8月17日周三
  1. Hugging Face Blog68

    Hugging Face 将 LLM.int8() 集成至 transformers 库

    Hugging Face 将 LLM.int8() 8-bit 量化技术集成至 transformers 和 accelerate 库,使 BLOOM-176B 等超大模型显存占用减半且性能无退化。该方案通过分离异常值计算,在 Turing 和 Ampere 架构 GPU 上实现高效推理。

    推荐理由:官方将LLM.int8()集成至transformers库,提供降低显存占用且保持性能的方法与代码示例。

5月2日周一
  1. Hugging Face Blog60

    使用 PyTorch FSDP 加速大模型训练

    Hugging Face 发布教程介绍如何使用 Accelerate 库集成 PyTorch Fully Sharded Data Parallel (FSDP) 训练大模型。实测显示 FSDP 相比 DDP 可将最大批量提升 2-3 倍,并支持 CPU Offload 在单卡运行 1.5B 模型。文章同时指出 FSDP 目前不支持混合精度,并强调需先准备模型再创建优化器以避免参数组丢失。

    推荐理由:文章通过 GPT-2 实测对比 DDP 与 FSDP,给出显存节省与批量提升数据,提供可直接复用的配置与代码规范。

9月14日周二
  1. Hugging Face Blog66

    Hugging Face 发布 Optimum 模型优化库

    Hugging Face 发布开源库 Optimum,旨在降低 Transformer 模型在生产环境中的部署难度。该库联合硬件合作伙伴(如 Intel)提供模型量化与加速工具,通过 Neural Compressor 等方案实现高效推理。

    推荐理由:Hugging Face 联合 Intel 发布 Optimum 库,提供开箱即用的模型量化与加速方案,降低生产环境部署门槛。

7月28日周三
4月16日周五
  1. Hugging Face Blog66

    Hugging Face 发布 Accelerate 库简化 PyTorch 分布式训练

    Hugging Face 发布 Accelerate 库,通过极简 API 封装分布式训练脚本添加少量代码即可适配多 GPU、TPU 及混合精度训练。该库自动处理设备放置、数据采样同步及梯度聚合,并提供 CLI 启动器简化配置流程。

    推荐理由:通过极简 API 封装分布式训练样板代码,使 PyTorch 原生脚本无缝适配多卡与混合精度。