Hugging Face 与 FriendliAI 合作优化模型部署
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成至 Hugging Face Hub 的“Deploy this model”按钮中。
Hugging Face 与 FriendliAI 达成合作,将 FriendliAI 推理基础设施集成至 Hugging Face Hub 的“Deploy this model”按钮中。
Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。
推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。
Hugging Face基于Open LLM Leaderboard评估的3000多个模型,量化了模型推理阶段的CO₂排放。研究发现,社区微调模型通常比官方基座模型更具碳效率,这主要归因于微调减少了输出冗余和重复模式,从而降低了推理时的计算开销。
Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。
推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。
NVIDIA发布LogitsProcessorZoo,提供模块化组件以直接修改语言模型的Logits分布。
推荐理由:原文详解NVIDIA LogitsProcessorZoo的四个核心处理器,提供代码示例展示如何控制生成长度、强制引用和格式。
在 Google Cloud 的 5代 Xeon C4 实例上,文本嵌入吞吐量比 N2 高 10-24 倍,文本生成高 2.3-3.6 倍。C4 每小时价格约为 N2 的 1.3 倍,在文本嵌入和生成任务中分别保持 7-19 倍和 1.7-2.9 倍的 TCO 优势。
Hugging Face 的 83 款开源模型现可通过 Amazon Bedrock Marketplace 部署,底层由 Amazon SageMaker Jumpstart 管理。
Hugging Face 正在重构 Hub 的上传与下载架构,引入内容寻址存储(CAS)以突破现有 CDN 50GB 文件大小限制。新架构采用“智能写入、哑读取”协议,通过字节级分析优化大模型权重等海量文件的传输效率。该设计还增强了企业用户的数据安全审计与日志追踪能力。
Hugging Face 发布 LayerSkip 技术,通过早期退出机制实现自推测解码,利用同一模型的不同层完成草稿生成与验证,显著降低显存占用并提升推理速度。官方同步开源了基于 Llama 系列的 LayerSkip 模型权重,并在 transformers 库中支持通过 assistant_early_exit 参数直接调用。
推荐理由:Hugging Face 官方开源了 LayerSkip 训练方法与模型,提供了在 transformers 中一键开启自推测解码的接口。
Mistral 在 La Plateforme 推出批量 API,处理高体积请求成本比同步 API 降低 50%。该功能适用于客户反馈分析、文档批量摘要及向量化等场景,单工作区限制 100 万并发请求。
Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。
推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。
Hugging Face 发布 Transformers.js v3,引入 WebGPU 支持,推理速度最高提升 100 倍。新增 120 种模型架构,支持 Node.js、Deno 和 Bun 环境,并提供 25 个新示例项目。
推荐理由:引入WebGPU加速与多端运行时支持,为前端和边缘端部署提供可迁移的高性能推理方案。
Keras 已原生支持加载 Llama 3.2 模型,用户可直接使用 safetensors 格式权重进行生成、训练和微调。文章演示了通过 keras-hub 调用模型,利用 JAX 后端实现多 GPU/TPU 并行推理,并展示了在 TPU 上微调 Llama 3.1 8B 模型的完整流程。
Gradio 5 发布,经 Trail of Bits 独立审计修复多项安全漏洞,默认保障机器学习应用安全。修复涵盖本地运行、Hugging Face Spaces 部署、内置分享链接及 CI 供应链等场景,包括 CORS 配置错误、SSRF、任意文件上传、远程代码执行及 GitHub Actions 风险。所有修复已验证并包含在 Gradio 5.0 版本中。
Hugging Face 验证 AMD 5th Gen EPYC Turin CPU 在 LLM 推理中实现 2 倍加速。通过 ZenDNN PyTorch 插件 zentorch 优化 torch.compile,AMD Turin 在 Meta LLaMA 3.1 8B 的摘要、聊天等五种场景下,吞吐量较 AMD Genoa 提升约 2 倍。
Hugging Face博客介绍利用Dask和Coiled将数据处理规模从100行扩展至2.11亿行的方法。通过FineWeb-Edu分类器在云端多GPU上并行运行文本分类,实现了TB级数据集的高效清洗与结构化。
Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。
推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。
Hugging Face 发布教程,介绍如何利用 Optimum-Intel 和 OpenVINO GenAI 将 Transformers 模型部署到边缘设备。内容涵盖环境配置、模型导出为 OpenVINO IR、基于 NNCF 的 INT4 量化优化,以及通过 LLMPipeline 在 Python 和 C++ 中进行推理部署的具体代码示例。
Hugging Face 发布基于 BitNet 架构的 LLaMA3 8B 1.58bit 模型,公开了通过动态 Lambda 调度实现微调的技术细节与 Triton 自定义内核,模型在 MMLU 等基准上表现优异。
推荐理由:文章公开了将LLaMA3微调至1.58bit的量化方法与代码,为降低大模型推理成本提供了可复用的工程方案。
Hugging Face 发布 Accelerate 1.0.0 首个候选版,新增 FP8 训练、torch.compile 及多模型 DeepSpeed 支持。该版本稳定了核心 API,并提供了详细的弃用项与迁移指南。
Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。
推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。
Meta Llama 3.1 405B 模型可在 Google Cloud Vertex AI 上部署,推荐使用 FP8 量化版本以适配 8 x H100 的 A3 节点。该模型具备 128K tokens 上下文窗口,支持多语言及工具使用。部署需配置 Vertex AI API 并申请 A3 节点配额。
Hugging Face 复现 Infini-Attention 失败,发现随着内存压缩次数增加,模型性能反而下降。在将 Llama 3 8B 扩展至 100 万 token 上下文的实验中,Ring Attention、YaRN 和 rope scaling 仍是目前延长预训练模型上下文长度的最佳方案。
ggml 是一个专注于 Transformer 推理的 C/C++ 开源机器学习库,具有极简、轻量且兼容性好的特点。该库核心代码少于 5 个文件,编译后二进制体积小于 1MB,支持量化张量以节省内存。本文面向开发者介绍 ggml 的基础概念、编译方法及核心 API 使用,涵盖上下文、计算图及后端接口等关键术语。
Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。
推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。
Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。
Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。
推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。
Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。
推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。
Mistral AI 开放 API 平台 Beta 版,提供 mistral-tiny、mistral-small 和 mistral-medium 三个生成端点以及 mistral-embed 嵌入端点。
推荐理由:平台提供三种不同性价比的生成端点和嵌入端点,开发者可据此评估模型性能与成本以适配生产需求。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,评估了 7B、13B 和 70B 参数规模模型在不同 EC2 实例和负载下的延迟与吞吐量。测试涵盖 GPTQ 4-bit 量化技术,旨在为最具成本效益、最佳延迟和最佳吞吐量场景提供优化策略。
Rocket Money 选择 Hugging Face Inference API 替代原有正则系统,以支撑其个人理财应用中超过 4000 个类别的交易分类任务。该方案成功应对了每月 1 亿笔交易的突发负载,实现了动态扩展与低延迟推理。经过三个月评估,Rocket Money 确认该服务具备高可用性,并与其建立了紧密的技术合作伙伴关系。
Hugging Face发布教程,展示如何利用PyTorch FSDP在2节点A100集群上微调Llama 2 70B。文章解决了加载模型时的CPU内存溢出、中间检查点保存耗时及VRAM不足三大挑战,通过Flash Attention和梯度检查点等技术实现高效训练。
Fetch 利用 Amazon SageMaker 与 Hugging Face 优化机器学习流水线,将最慢扫描的延迟降低 50%。该方案通过 Amazon SageMaker Model Training 和 Processing 提升文档理解模型精度 200%,并借助 Hugging Face AWS Deep Learning Container 简化部署。
Hugging Face Hub 正式登陆 AWS Marketplace,用户现可通过 AWS 账户直接订阅并支付 Hugging Face 服务费用。该集成计费方式涵盖 Inference Endpoints、Spaces Hardware Upgrades 和 AutoTrain 等托管服务,支持组织内成员统一管理账单。
BentoML 通过定义 Service、构建 Bento 并部署至 Kubernetes 或 Yatai,实现 DeepFloyd IF 的高效生产级部署。DeepFloyd IF 采用三级级联像素扩散架构,利用 T5-XXL-1.1 编码提示词以增强复杂指令理解。该方案支持对 Stage 1 至 Stage 3 的 Runners 独立扩展资源,满足高并发推理需求。
Zama 提出利用全同态加密(FHE)技术,在保护用户查询隐私的同时维护模型知识产权。通过 Hugging Face transformers 库与 Concrete-Python,将 GPT2 的注意力机制适配至 TFHE 架构,实现加密数据上的模型推理。实验显示,采用 4-bit 量化后,模型在加密状态下仍能保持原始精度的 96%。
Hugging Face 展示了如何在 Intel Sapphire Rapids CPU 集群上微调 Stable Diffusion 模型。通过利用 AMX 硬件加速、oneCCL 和 Intel Extension for PyTorch (IPEX),结合 textual inversion 技术,仅需少量示例图片即可完成训练。
本文介绍利用 Node.js 和 Hugging Face Inference Endpoints API 构建 Web 应用生成器的教程。以 WizardCoder-15B 模型为例,通过流式传输 HTML 内容实现文本到网页的生成。文章详细讲解了项目初始化、API 配置、提示词优化及防止模型幻觉的方法。
Writer 联合创始人兼 CTO Waseem Alshikh 分享了公司从 Hugging Face 用户转变为开源模型贡献者的历程。Writer 探讨了生成式 AI 的常见误解,并介绍了 Hugging Face Expert Acceleration Program 对其业务的价值。此外,文章还讨论了在 CPU 和 GPU 上大规模服务 LLM 的生产方法以及效率的重要性。
Optimum Habana v1.7 在 Habana Gaudi2 上微调 BridgeTower 模型,相比 Nvidia A10 A100 实现 2.5 倍加速,相比 H100 实现 1.4 倍加速。该性能提升依赖于硬件加速的数据加载技术,通过增加 dataloader_num_workers 有效缓解了图像解码与增强带来的 CPU 瓶颈。