跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–40 条 · 共 52 条
9月1日周二
  1. Hugging Face Blog75

    Hugging Face 发布 207 个 WebGPU 内核及加载库

    Hugging Face 发布 @huggingface/kernels 库及 207 个 WebGPU 内核,每个内核作为独立版本化仓库发布,包含接口、测试和基准数据。在 Apple M4 上实测,其内核比 ORT WebGPU 快 2.57 倍,并推出 Fleet 工具用于众包设备性能测试。

    推荐理由:Hugging Face 开源了 207 个 WebGPU 内核及加载库,实测性能显著优于 ORT WebGPU,为浏览器端推理提供了可复用的底层基础。

8月25日周二
  1. Hugging Face Blog80

    量化感知愈合:压缩的 4-bit 模型超越全精度原版

    Multiverse Computing 提出量化感知愈合(QAH)方法,将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项上超越其全精度版本。该方法通过从原始模型蒸馏而非恢复后的检查点,解决了结构压缩后的能力下降问题。

    推荐理由:提出量化感知愈合方法,使压缩量化后的模型在多项基准上超越全精度版本。

  2. Hugging Face Blog77

    Gradio 内置 Workflow 功能发布

    Gradio 内置 gr.Workflow 功能,允许开发者通过拖拽构建可视化 AI 管线,并自动生成 REST API 和一键部署到 Hugging Face Spaces。

    推荐理由:Gradio 内置 Workflow 将 AI 管线转为可视化界面与 REST API,降低多模型编排门槛。

8月19日周三
  1. Hugging Face Blog80

    IBM研究:智能体记忆剂量需按模型能力校准

    IBM发布ALTK-Evolve研究,发现智能体记忆需按模型能力分级注入。强模型适用全量指南,弱模型适用检索,饱和模型无增益。检索策略能以极低成本提升弱模型表现,全量指南可通过提示词缓存降低开销。

    推荐理由:研究揭示了智能体记忆需按模型能力分级注入,为兼顾性能与成本的Agent部署提供了可迁移的校准方法。

8月18日周二
  1. Hugging Face Blog70

    Dharma AI 约束感知 GPU 分配器:通过调度顺序提升利用率

    Dharma AI 发布约束感知 GPU 分配器,在相同硬件上通过优化调度顺序,将 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。该方案将实时推理视为需求曲线而非固定预留,并结合优先级与时间衰减权重进行全局规划,在 1-15 毫秒内完成决策。

    推荐理由:原文给出了约束感知分配器的设计逻辑与实测数据,读者可据此优化集群调度策略。

8月14日周五
  1. Hugging Face Blog70

    Strands Robots 结合 Storage Buckets 实现机器人数据流式闭环

    AWS Strands Robots 结合 Hugging Face Storage Buckets 实现机器人数据闭环。通过 Xet 字节级去重降低同步成本,利用流式读取避免全量下载,完成从采集、训练到部署的无缝衔接。

    推荐理由:原文给出了基于 Storage Buckets 和流式读取的机器人数据闭环实操,读者可据此优化采集训练部署流程。

8月10日周一
7月29日周三
  1. Berkeley AI Research75

    K-Search:将CUDA内核优化经验自动迁移至Apple Silicon

    IBM Research基于K-Search框架开发结构化CUDA-to-MLX翻译层,将CUDA内核优化知识自动迁移至Apple Silicon。在Attention内核上达到原生MLX 0.97倍性能,在Mamba SSM内核上预填充速度较社区实现提升20倍。

    推荐理由:提出跨平台内核优化思路,将CUDA经验自动迁移至Apple Silicon,在Mamba SSM上实现20倍预填充加速。

7月10日周五
  1. Hugging Face Blog66

    PyTorch Profiling 第三篇:注意力机制的Profiler迹线分析

    Hugging Face 发布 PyTorch Profiling 系列第三篇,对比了朴素注意力、in-place掩码、SDPA math/efficient/flash/cuDNN 五种实现的Profiler迹线。文章解释了FlashAttention低占用率源于片上资源占用,cuDNN高CPU开销源于运行时内核生成,并指出math后端因FP32上转换和多次HBM读写导致性能最差。

    推荐理由:通过对比五种注意力实现的Profiler迹线,揭示了FlashAttention低占用率与cuDNN高CPU开销的底层原因。

7月8日周三
  1. Hugging Face Blog63

    Hugging Face 与 Amazon SageMaker AI 实现一键深度集成

    Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在 Hugging Face 模型页点击按钮直接进入 SageMaker Studio 进行微调或部署。新环境自动预配置权限,并支持在实例选择时直接查看 GPU 配额。

    推荐理由:一键打通模型发现与部署流程,省去手动配置权限和环境的繁琐步骤。

7月7日周二
  1. Hugging Face Blog70

    微软 Foundry 平台上线 Hugging Face 托管计算服务

    微软在 Build 2026 宣布推出 Foundry Managed Compute,将 Hugging Face 生态中的精选开源模型纳入企业级托管服务。该服务提供一键部署、自动运行时升级与安全扫描,支持 vLLM 等多种推理引擎,并统一了认证、监控与计费接口。

    推荐理由:微软将 Hugging Face 模型纳入企业级托管服务,提供开箱即用的安全与运维能力,降低了开源模型的生产部署门槛。

  2. Hugging Face Blog78

    Hugging Face 与 SkyPilot 联合推出零出口流量存储方案

    Hugging Face 与 SkyPilot 联合推出 `store: hf` 功能,允许在任意云或本地集群上直接挂载 Hugging Face Hub 上的模型和数据集,读取数据不产生出口流量费用。该方案基于 Xet 存储实现增量去重,支持懒加载和断点续传,显著降低了跨云训练和推理的存储与传输成本。

    推荐理由:通过零出口流量存储和跨云调度,解决了模型数据与算力分离带来的高昂跨云传输成本。

7月6日周一
  1. Hugging Face Blog68

    Hugging Face Kernels 重大更新:引入可信发布与代码签名

    Hugging Face 对 Kernels 项目进行重大更新,在 Hub 上引入 kernel 专属仓库类型,默认启用可信发布者机制并支持代码签名以增强安全性。项目新增对 Torch Stable ABI 和 Apache TVM FFI 的支持,并重构 CLI 以更好地支持智能体开发工作流。

    推荐理由:Hugging Face重构了Kernels项目,引入可信发布与代码签名机制,并新增对Torch Stable ABI和TVM FFI的支持。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 发布实时语音 AI 演示

    Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。

    推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。

6月26日周五
  1. Hugging Face Blog71

    一条命令在 Hugging Face Jobs 上运行 vLLM 服务

    Hugging Face 推出 HF Jobs 功能,允许用户通过单条命令在 HF 基础设施上快速部署 vLLM 服务并开放 OpenAI 兼容接口。该服务支持按秒计费,提供 GPU 选择、SSH 调试、Gradio 交互界面及编码 Agent 后端集成,适合模型测试、评估和批量生成等实验场景。

    推荐理由:提供通过单条命令在 HF Jobs 部署 vLLM 并开放 OpenAI 兼容接口的完整流程,便于快速进行模型测试与评估。

6月25日周四
  1. Hugging Face Blog75

    NVIDIA NeMo AutoModel 发布,基于 Transformers v5 加速 MoE 微调

    NVIDIA 发布 NeMo AutoModel,基于 HuggingFace Transformers v5 提供专家并行、DeepEP 融合通信和 TransformerEngine 内核。在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B-A3B 上,训练吞吐量提升 3.4-3.7 倍,GPU 显存降低 29-32%,并支持 550B 模型全量微调。

    推荐理由:NeMo AutoModel 在保持 Transformers v5 API 兼容的前提下,通过专家并行和内核优化显著提升 MoE 微调性能。

6月23日周二
  1. Hugging Face Blog80

    Hugging Face 开源每周自动化发布工作流:AI 起草与人工校验

    Hugging Face 开源了 huggingface_hub 的每周自动化发布工作流,利用 GLM-5.2 等开源模型起草发布说明,并通过确定性脚本校验 PR 完整性,人工仅需少量时间审核。该流程结合 GitHub Actions 与 PyPI 可信发布,将发布周期从 4-6 周缩短至每周一次,且成本极低。

    推荐理由:提供了一套基于开源模型与确定性校验的自动化发布工作流,可迁移至其他开源项目以大幅降低维护成本。