跳到正文

#部署/工程

今日 4 条
1月22日周三
1月16日周四
  1. Hugging Face Blog70

    TGI 引入多后端支持,统一 vLLM 与 TensorRT-LLM 部署

    Hugging Face 发布 TGI Backends 架构,通过统一前端层集成 vLLM、TensorRT-LLM 和 llama.cpp 等推理引擎。该更新旨在简化生产环境部署,计划于 2025 年第一季度支持 vLLM,并持续扩展对 AWS Neuron 和 Google TPU 的原生支持。

    推荐理由:原文给出了统一前端架构和具体后端规划,读者可据此评估现有部署路径的迁移成本与性能收益。

1月9日周四
12月24日周二
  1. Hugging Face Blog68

    PyTorch 训练时 GPU 显存可视化与估算方法

    Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。

    推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。

12月23日周一
12月17日周二
12月9日周一
11月26日周二
  1. Hugging Face Blog32

    Hugging Face 重构 Hub 上传与下载架构

    Hugging Face 正在重构 Hub 的上传与下载架构,引入内容寻址存储(CAS)以突破现有 CDN 50GB 文件大小限制。新架构采用“智能写入、哑读取”协议,通过字节级分析优化大模型权重等海量文件的传输效率。该设计还增强了企业用户的数据安全审计与日志追踪能力。

11月20日周三
  1. Hugging Face Blog70

    Hugging Face 开源 LayerSkip 自推测解码方法与模型

    Hugging Face 发布 LayerSkip 技术,通过早期退出机制实现自推测解码,利用同一模型的不同层完成草稿生成与验证,显著降低显存占用并提升推理速度。官方同步开源了基于 Llama 系列的 LayerSkip 模型权重,并在 transformers 库中支持通过 assistant_early_exit 参数直接调用。

    推荐理由:Hugging Face 官方开源了 LayerSkip 训练方法与模型,提供了在 transformers 中一键开启自推测解码的接口。

11月7日周四
10月29日周二
  1. Hugging Face Blog78

    Universal Assisted Generation:跨模型加速推理方法

    Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。

    推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。

10月22日周二
10月21日周一
10月10日周四
  1. Hugging Face Blog42

    Gradio 5 安全审计:修复多项漏洞,默认保障 ML 应用安全

    Gradio 5 发布,经 Trail of Bits 独立审计修复多项安全漏洞,默认保障机器学习应用安全。修复涵盖本地运行、Hugging Face Spaces 部署、内置分享链接及 CI 供应链等场景,包括 CORS 配置错误、SSRF、任意文件上传、远程代码执行及 GitHub Actions 风险。所有修复已验证并包含在 Gradio 5.0 版本中。

10月9日周三
10月8日周二
  1. Hugging Face Blog75

    Hugging Face Transformers 4.45.0 默认启用动态推测解码

    Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。

    推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。

9月20日周五
9月18日周三
9月13日周五
8月21日周三
  1. Hugging Face Blog68

    Hugging Face 发布 DataCollatorWithFlattening 实现 Flash Attention 2 无填充训练

    Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。

    推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。

8月19日周一
8月14日周三
8月13日周二
  1. Hugging Face Blog30

    ggml 入门指南

    ggml 是一个专注于 Transformer 推理的 C/C++ 开源机器学习库,具有极简、轻量且兼容性好的特点。该库核心代码少于 5 个文件,编译后二进制体积小于 1MB,支持量化张量以节省内存。本文面向开发者介绍 ggml 的基础概念、编译方法及核心 API 使用,涵盖上下文、计算图及后端接口等关键术语。

8月12日周一
  1. Hugging Face Blog73

    Hugging Face 推出统一工具调用 API 与工程实践

    Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。

    推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。

8月6日周二
  1. Hugging Face Blog32

    Hugging Face 2024 安全功能亮点

    Hugging Face 于 2024 年 8 月 6 日发布了 Hub 平台的安全功能亮点。面向所有用户,平台提供细粒度 Token 访问控制、双因素认证 (2FA)、Commit 签名、组织访问控制及包含恶意软件与密钥扫描的自动化安全扫描。针对 Enterprise 用户,平台进一步支持基于 SAML 2.0 和 OpenID Connect 协议的单点登录 (SSO) 以及资源组管理。

6月5日周三
  1. Mistral AI68

    Mistral 推出模型微调服务与开源 SDK

    Mistral 在 la Plateforme 推出模型微调服务,提供开源微调 SDK、托管微调及定制训练三种方式。托管服务兼容 Mistral 7B 和 Mistral Small,采用 LoRA 技术实现高效微调。

    推荐理由:提供开源SDK、托管微调及定制训练三种入口,覆盖不同技术栈与数据需求。

12月11日周一
  1. Mistral AI88

    Mistral AI 发布 Mixtral 8x7B 开源模型

    Mistral AI 发布 Mixtral 8x7B 开源模型,采用稀疏混合专家架构,总参数 46.7B 但每次推理仅使用 12.9B 参数。该模型在多数基准测试中超越 Llama 2 70B 并匹敌 GPT-3.5,支持 32k 上下文窗口,推理速度提升 6 倍。同时发布经过指令微调的 Instruct 版本,在 MT-Bench 上得分 8.30。

    推荐理由:原文给出了稀疏混合专家架构的具体参数与推理速度对比,读者可以据此评估其在成本与性能上的优势。

9月26日周二
  1. Hugging Face Blog42

    Llama 2 在 Amazon SageMaker 上的基准测试

    Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,评估了 7B、13B 和 70B 参数规模模型在不同 EC2 实例和负载下的延迟与吞吐量。测试涵盖 GPTQ 4-bit 量化技术,旨在为最具成本效益、最佳延迟和最佳吞吐量场景提供优化策略。

9月19日周二
  1. Hugging Face Blog13

    Rocket Money 携手 Hugging Face 实现 ML 模型规模化生产部署

    Rocket Money 选择 Hugging Face Inference API 替代原有正则系统,以支撑其个人理财应用中超过 4000 个类别的交易分类任务。该方案成功应对了每月 1 亿笔交易的突发负载,实现了动态扩展与低延迟推理。经过三个月评估,Rocket Money 确认该服务具备高可用性,并与其建立了紧密的技术合作伙伴关系。

9月13日周三
9月1日周五
8月10日周四
8月9日周三
  1. Hugging Face Blog28

    BentoML 部署 DeepFloyd IF 实战指南

    BentoML 通过定义 Service、构建 Bento 并部署至 Kubernetes 或 Yatai,实现 DeepFloyd IF 的高效生产级部署。DeepFloyd IF 采用三级级联像素扩散架构,利用 T5-XXL-1.1 编码提示词以增强复杂指令理解。该方案支持对 Stage 1 至 Stage 3 的 Runners 独立扩展资源,满足高并发推理需求。

8月2日周三
  1. Hugging Face Blog40

    利用全同态加密保护大语言模型隐私

    Zama 提出利用全同态加密(FHE)技术,在保护用户查询隐私的同时维护模型知识产权。通过 Hugging Face transformers 库与 Concrete-Python,将 GPT2 的注意力机制适配至 TFHE 架构,实现加密数据上的模型推理。实验显示,采用 4-bit 量化后,模型在加密状态下仍能保持原始精度的 96%。

7月14日周五
7月3日周一
7月1日周六
6月29日周四