跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

167条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 141–160 条 · 共 167 条
3月22日周五
  1. Hugging Face Blog80

    Hugging Face 发布嵌入向量量化教程:二进制与标量量化加速检索

    Hugging Face 发布嵌入向量量化教程,介绍二进制与标量量化技术,通过 Sentence Transformers 代码示例展示如何在保持检索性能的同时显著降低内存、存储和成本。

    推荐理由:文章提供了 Sentence Transformers 量化代码与实验数据,帮助开发者在检索场景中平衡性能与成本。

3月20日周三
  1. Hugging Face Blog60

    在Intel Meteor Lake笔记本上运行Phi-2

    Hugging Face与Intel合作演示如何在搭载Core Ultra处理器的笔记本上本地运行Phi-2模型。通过Optimum Intel集成OpenVINO对Phi-2进行4-bit量化,在保留生成质量的同时实现低延迟推理,并提供了完整的代码配置与性能视频。

    推荐理由:提供在Intel Meteor Lake笔记本上量化部署Phi-2的完整代码与配置,展示端侧推理的隐私与延迟优势。

  2. Hugging Face Blog70

    GaLore:在消费级硬件上高效训练大语言模型

    Hugging Face发布GaLore优化器,利用梯度低秩结构投影技术将优化器状态显存占用降低82.5%以上,结合8-bit量化可在RTX 4090等消费级显卡上训练7B参数模型。该方案支持动态子空间切换与层更新,已集成于transformers库,用户可通过pip安装galore-torch并使用galore_adamw等优化器进行微调。

    推荐理由:GaLore通过低秩投影显著降低显存占用,配合8-bit优化器可在消费级显卡上训练大模型,提供了可复用的训练方案。

3月18日周一
  1. Hugging Face Blog72

    Hugging Face 发布 Optimum-Quanto 量化后端

    Hugging Face 发布 Optimum-Quanto,一个面向 PyTorch 的量化后端,支持 int2/int4/int8/float8 权重与激活量化,无缝集成 transformers 库,支持 CPU/GPU/MPS 设备与 torch.compile。

    推荐理由:提供了从动态量化到静态冻结的完整工作流,并原生支持 transformers 集成,便于快速部署。

3月15日周五
  1. Hugging Face Blog68

    使用 Optimum Intel 和 fastRAG 在 CPU 上优化 Embedding 模型

    Hugging Face 发布教程,展示如何利用 Optimum Intel 对 BGE 等 Embedding 模型进行 int8 量化,并在 Intel Xeon CPU 上实现最高 4.5 倍的延迟降低和 4 倍的吞吐量提升。文章提供了集成 fastRAG 框架进行 RAG 检索与重排的具体代码示例。

    推荐理由:提供基于 Optimum Intel 量化 BGE 模型的完整代码,展示如何在 Intel CPU 上实现 RAG 检索与重排的低延迟加速。

2月23日周五
2月16日周五
  1. Hugging Face Blog87

    Hugging Face 博客:使用合成数据训练专用模型以节省成本

    Hugging Face 发布教程,展示如何利用 Mixtral 等大模型生成合成数据,微调 RoBERTa 等小型专用模型。在金融情感分析案例中,该方案推理成本降至约 2.7 美元(GPT-4 为 3061 美元),碳排放减少至 0.12 千克,且准确率与 GPT-4 持平。

    推荐理由:通过金融情感分析案例,展示了利用开源模型生成合成数据微调专用模型的方法,显著降低推理成本与碳排放。

2月8日周四
  1. Hugging Face Blog70

    Hugging Face 推出 Messages API 实现与 OpenAI 兼容

    Hugging Face 在 TGI 1.4.0 版本中引入 Messages API,提供与 OpenAI Chat Completion API 兼容的接口。该功能支持通过 OpenAI 客户端库、LangChain 和 LlamaIndex 直接调用部署在 Inference Endpoints 上的开源模型,简化了从 OpenAI 到开源 LLM 的迁移流程。

    推荐理由:提供与 OpenAI 兼容的接口,帮助开发者低成本将应用迁移至 Hugging Face 开源模型。

1月19日周五
  1. Hugging Face Blog68

    Hugging Face 发布 PatchTSMixer 时间序列模型

    IBM与Hugging Face联合在Transformers库中发布PatchTSMixer,这是一种基于MLP-Mixer架构的轻量级时间序列建模方法。该模型在预测任务中比现有MLP和Transformer模型性能提升8-60%,同时内存和运行时间减少2-3倍。文章提供了在Electricity和ETTh2数据集上进行预测、零样本迁移学习和微调的完整代码示例。

    推荐理由:IBM与Hugging Face联合发布PatchTSMixer,提供轻量级时间序列预测方案及完整教程。

12月20日周三
  1. Hugging Face Blog75

    使用推测解码将 Whisper 推理速度提升 2 倍

    Hugging Face 博客发文演示了如何在 Whisper 模型中应用推测解码(Speculative Decoding)技术。通过引入 Distil-Whisper 作为辅助模型,在保持转录精度完全一致的前提下,将 16GB T4 GPU 上的推理时间缩短约 2 倍。文章提供了基于 Transformers 库的完整代码实现,并探讨了多语言场景下的模型选择及批处理策略。

    推荐理由:文章提供了基于 Transformers 库的完整代码,演示了如何利用 Speculative Decoding 在不损失精度的前提下将 Whisper 推理速度提升约 2 倍。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

  2. Hugging Face Blog86

    Hugging Face 发布 Mixtral 8x7B 模型集成与部署指南

    Hugging Face 发布 Mixtral 8x7B 模型集成指南,该模型采用 MoE 架构,在多数基准测试中超越 GPT-3.5 并匹敌 Llama 2 70B。文章提供了基于 Transformers 和 TGI 的推理代码,以及使用 QLoRA 和 GPTQ 在单卡 A100 上进行微调与量化的具体实践。

    推荐理由:文章详细拆解了MoE架构与量化部署方案,为开发者提供了在有限显存下运行该模型的具体工程路径。

12月5日周二
  1. Hugging Face Blog68

    Hugging Face 发布 Optimum-NVIDIA 库,一行代码解锁极速 LLM 推理

    Hugging Face 发布 Optimum-NVIDIA 推理库,利用 NVIDIA FP8 格式和 TensorRT-LLM 技术,通过修改一行代码即可实现最高 28 倍的吞吐量提升和 1200 tokens/秒的推理速度。

    推荐理由:通过一行代码切换即可利用FP8和TensorRT-LLM实现最高28倍吞吐提升,为LLM部署提供了极简的高性能方案。

10月24日周二
  1. Hugging Face Blog75

    Hugging Face 复现 OpenAI 原始 RLHF 代码的 N 个实现细节

    Hugging Face 博客复现了 OpenAI 2019 年 RLHF 代码库,在风格化任务中匹配了原始学习曲线,并整理了包括奖励模型初始化、位置索引处理、拒绝采样、KL 惩罚及 PyTorch 与 TensorFlow Adam 优化器差异在内的关键实现细节。

    推荐理由:文章复现了 OpenAI 原始 RLHF 代码并整理出关键实现细节,为复现 PPO 训练提供了可迁移的工程参考。

5月23日周二
  1. Hugging Face Blog65

    Safetensors 通过安全审计并将在 Transformers 中成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的安全审计,确认无导致任意代码执行的严重漏洞。该库将作为核心依赖加入 Transformers 并设为默认保存格式,提供比 pickle 更安全且加载速度更快的张量存储方案。

    推荐理由:官方联合第三方完成安全审计并宣布将其设为默认格式,为模型加载提供了安全与性能保障。

4月5日周三
  1. Hugging Face Blog65

    StackLLaMA:手把手教你用RLHF微调LLaMA模型

    Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。

    推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。

3月9日周四