跳到正文

#部署/工程

今日 4 条
11月25日周二
11月22日周六
11月21日周五
  1. Hugging Face Blog70

    Hugging Face TRL 官方集成 RapidFire AI 实现 20 倍加速微调

    Hugging Face TRL 官方集成 RapidFire AI,通过自适应分块调度与并发训练机制,实现多配置微调加速 16-20 倍。提供实时仪表盘与 IC Ops 功能,支持在训练中途停止低效配置或克隆优化参数,无需重启任务。

    推荐理由:官方集成提供并发微调与实时干预能力,可显著降低多配置对比的时间与算力成本。

11月5日周三
  1. Google Research30

    Google Project Suncatcher 发布太空 AI 基础设施系统设计研究

    Google 发布 Project Suncatcher 研究,提出由搭载 Google TPUs 的太阳能卫星组成的星座,通过自由空间光链路连接以构建可扩展的太空 AI 基础设施。早期实验验证了单对收发器可实现 800 Gbps 传输,Trillium v6e Cloud TPU 在辐射测试中表现稳健,预计 2030 年代中期发射成本将降至 200 美元/kg 以下。

10月29日周三
  1. Hugging Face Blog81

    Hugging Face:美国出口管制如何重塑全球AI算力与开源格局

    Hugging Face发布深度分析,指出美国出口管制反而加速了中国国产芯片与开源模型的协同创新。DeepSeek、Qwen等模型通过架构优化降低推理成本,并率先适配华为昇腾等国产硬件。这种“非NVIDIA优先”策略正在催生独立于CUDA的软件生态,推动全球AI基础设施向多极化演变。

    推荐理由:文章梳理了美国出口管制如何倒逼中国加速国产芯片与开源模型协同创新,揭示了全球AI算力格局的重构路径。

10月16日周四
10月11日周六
9月29日周一
9月19日周五
9月11日周四
  1. Hugging Face Blog76

    Hugging Face transformers 升级支持 GPT-OSS 及多项部署优化

    Hugging Face 升级 transformers 库以支持 OpenAI GPT-OSS 系列模型,新增 MXFP4 量化、张量并行、专家并行及动态滑动窗口缓存等部署优化。通过 Hub 下载预编译内核,显著降低显存占用并提升推理效率。

    推荐理由:Hugging Face 为 GPT-OSS 提供开箱即用的部署支持,涵盖 MXFP4 量化与多卡并行,为社区提供了可复用的工程参考。

  2. Hugging Face Blog65

    Together AI 支持在 Hugging Face Hub 上直接微调模型

    Together AI 宣布与 Hugging Face 集成,允许开发者通过 API 直接微调 Hugging Face Hub 上的兼容模型。用户只需指定基础模型配置和 HF 模型,即可利用 Together 基础设施完成训练,并可将结果推回 Hub。

    推荐理由:Together AI 打通 Hugging Face Hub 实现一键微调,降低开发门槛并加速模型迭代。

9月2日周二
  1. Hugging Face Blog72

    Hugging Face 教程:在 ZeroGPU Spaces 中使用 PyTorch 提前编译加速

    Hugging Face 发布教程,展示如何在 ZeroGPU Spaces 中利用 PyTorch 提前编译(AoT)技术加速图像和视频生成。通过结合 FP8 量化、动态形状处理和 FlashAttention-3,FLUX.1-dev 等模型可获得 1.3 至 1.8 倍的速度提升。

    推荐理由:原文给出了在ZeroGPU上结合AoT编译与量化加速的具体代码,读者可直接复用以优化生成类应用。

8月18日周一
  1. Hugging Face Blog68

    从零构建生产级CUDA内核:PyTorch原生算子开发与Hub分发指南

    Hugging Face发布kernel-builder教程,指导开发者从零构建生产级CUDA内核。通过build.toml和flake.nix实现环境隔离与多架构编译,将内核注册为PyTorch原生算子以兼容torch.compile,并支持通过Hub进行版本管理与分发。

    推荐理由:文章提供从零构建可复用PyTorch CUDA内核的完整工程指南,涵盖构建、版本控制与Hub分发。

8月12日周二
  1. Hugging Face Blog42

    Arm 发布 Neural Super Sampling 实时超采样方案

    Arm 发布 Neural Super Sampling (NSS),一款专为移动端 GPU 神经网络加速器优化的实时时序超采样模型。在演示中,NSS 将 540p 渲染结果在 4ms 内超采样至 1080p,并降低 50% GPU 负载。该模型已集成至 Unreal Engine 插件及 Vulkan ML 扩展,供开发者在移动游戏和 XR 场景中实验。

8月8日周五
8月7日周四
  1. Hugging Face Blog75

    TRL 新增 MPO、GRPO 等视觉语言模型对齐算法及 vLLM 集成

    Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。

    推荐理由:TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。

8月5日周二
  1. Hugging Face Blog92

    OpenAI 发布 GPT OSS 开源推理模型,Hugging Face 详解部署与推理优化

    OpenAI 发布 GPT OSS 开源模型系列,包含 120B 和 20B 两个 MoE 版本,采用 mxfp4 量化以支持单卡部署。Hugging Face 提供详细指南,涵盖 transformers、vLLM 和 llama.cpp 等框架的本地推理、Flash Attention 3 优化及工具调用能力。

    推荐理由:OpenAI 发布开源推理模型,Hugging Face 提供从本地量化部署到云端推理的完整工程支持。

8月1日周五
  1. Mistral AI42

    Mistral 通过 LoRA 微调 Pixtral-12B 提升卫星图像分类性能

    Mistral 展示通过 LoRA 微调 Pixtral-12B 在卫星图像分类任务上的显著性能提升。基线模型在区分“游乐场”与“体育场”等细微视觉差异时存在幻觉,微调后模型能更准确地识别密集住宅、稀疏住宅等复杂场景。该过程利用 Mistral 微调 API 或 LaPlateforme UI 即可高效完成,无需 extensive 超参数调整。

7月25日周五
7月23日周三
7月22日周二
  1. Hugging Face Blog65

    NVIDIA NIM 支持一键部署 Hugging Face 上的 10 万+ LLM

    NVIDIA 宣布 NIM 推理微服务现支持在 Hugging Face 上快速部署超过 10 万个大语言模型。NIM 提供单一 Docker 容器,自动识别模型格式并选择 TensorRT-LLM、vLLM 或 SGLang 后端,无需手动配置即可实现高性能部署。

    推荐理由:NVIDIA NIM 提供统一容器自动适配 Hugging Face 模型,简化了部署流程。

7月15日周二
  1. Hugging Face Blog72

    Hugging Face 宣布全面迁移至 Xet 存储系统

    Hugging Face 宣布将 Hub 全面迁移至 Xet 存储系统,目前已有超 100 万用户和 50 万个仓库使用。Xet 将成为新用户的默认存储,旧仓库将自动迁移,同时 Hugging Face 计划开源 Xet 协议及底层基础设施。

    推荐理由:Hugging Face 宣布全面迁移至 Xet 存储,通过底层架构升级实现 PB 级数据的高效传输与无缝兼容。

7月9日周三
  1. Hugging Face Blog70

    Hugging Face 发布针对 AMD MI300X 的自定义内核优化实践

    Hugging Face 与 AMD 合作开源了针对 MI300X 的自定义内核,通过融合 RMS norm 与 FP8 转换、优化 SwiGLU 计算以及针对低批次大小的 Skinny GEMM 拆分策略,显著提升了 Llama 3.1 405B 在 VLLM 中的推理性能。

    推荐理由:文章详细拆解了针对MI300X的三种自定义内核优化技巧,提供了可复用的工程实践方法。

7月3日周四
  1. Mistral AI35

    Mistral AI 发布 AI for Citizens 倡议

    Mistral AI 推出 AI for Citizens 倡议,旨在帮助各国政府及公共机构利用 AI 技术重塑公共服务并推动创新。该计划提供 Mistral AI 的尖端模型、AI 聊天与编程助手,支持私有化部署、SaaS 及无服务器 API 等多种方式,确保数据主权与合规。通过定制化研发与生态建设,助力各国摆脱对封闭供应商的依赖,实现 AI 技术的自主可控。

6月11日周三
  1. Mistral AI50

    Mistral AI 发布 Mistral Compute 基础设施服务

    Mistral AI 发布 Mistral Compute,提供包含 GPU、编排、API 及服务的私有集成 AI 基础设施栈。作为 NVIDIA 合作伙伴,该服务提供数万张 GPU 资源,支持从裸金属服务器到全托管 PaaS 的多种形态。此举旨在满足欧洲等地区对数据主权和可持续性的要求,为各国政府、企业及研究机构提供独立可控的 AI 算力环境。

5月21日周三
  1. Hugging Face Blog73

    Hugging Face Diffusers 量化后端对比与选型指南

    Hugging Face 发布博文对比了 Diffusers 中 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种量化后端。文章以 Flux-dev 模型为例,展示了各方案在显存占用和推理速度上的基准测试数据,并提供了结合 CPU offload 和 torch.compile 的优化代码示例。

    推荐理由:原文对比了 Diffusers 中五种量化后端在显存占用和推理速度上的表现,并给出了代码示例和选型建议。

5月15日周四
  1. Hugging Face Blog70

    Falcon-Edge 发布可微调的 1.58bit 语言模型及 onebitllms 工具包

    Falcon-Edge 系列发布 1B 和 3B 参数的 1.58bit 语言模型,支持同时输出非量化和量化变体。官方配套推出 onebitllms 工具包,提供预量化权重转换和微调方法,降低 BitNet 架构的二次开发门槛。

    推荐理由:Falcon-Edge 提供可微调的 1.58bit 模型与 onebitllms 工具包,为端侧部署和二次开发提供了可复用的工程方案。

4月29日周二
  1. Hugging Face Blog70

    Intel 发布 AutoRound 大模型与多模态模型量化工具

    Intel 发布 AutoRound,一种用于 LLM 和 VLM 的权重量后训练量化(PTQ)工具。它通过符号梯度下降联合优化权重舍入和裁剪范围,在 INT2 至 INT8 低比特量化下保持高精度,量化 72B 模型仅需 37 分钟。支持 Qwen、LLaMA 等主流模型,兼容 CPU/GPU,可导出为 AutoRound、GPTQ、AWQ 和 GGUF 格式。

    推荐理由:Intel 发布 AutoRound 工具,以低算力开销实现高精度低比特量化,为 LLM 和 VLM 的高效部署提供新方案。

4月16日周三
4月9日周三
  1. Mistral AI61

    Mistral 发布基于 RAG Triad 的 LLM 评估教程

    Mistral 发布教程,介绍利用结构化输出功能实现 LLM as a Judge 来评估 RAG 系统。该方案基于 RAG Triad 框架,从上下文相关性、事实依据性和答案相关性三个维度进行量化评分,并提供了完整的 Pydantic 代码实现。

    推荐理由:提供基于RAG Triad的LLM评估框架与结构化输出代码,可直接复用于构建自动化评测流程。

4月2日周三
  1. Hugging Face Blog42

    高效请求队列:优化 LLM 性能

    针对多用户并发请求导致 GPU 资源竞争及“超级用户”阻塞其他用户的问题,TNG Technology Consulting 提出在 LLM-Server 层实现公平调度。通过为每个用户建立独立队列并采用轮询机制,避免请求在 vLLM 后端堆积。同时结合 Prometheus 指标动态调整发送速率,以维持后端队列短小从而降低新用户的延迟。

3月31日周一
3月21日周五
  1. Hugging Face Blog22

    Inference Endpoints 全新分析功能

    Hugging Face 对 Inference Endpoints 的分析仪表盘进行了全面升级。更新后的仪表盘支持指标实时刷新,提供可自定义的时间范围与自动刷新功能,并新增副本生命周期视图以追踪各副本状态。后端重构确保高流量场景下数据加载迅速,帮助用户实时监控延迟、错误率等性能指标。

3月20日周四
  1. Hugging Face Blog72

    如何在本地使用 OlympicCoder 进行编码

    LM Studio 发布教程,指导用户将 OlympicCoder 7B 模型通过 LM Studio 和 VS Code 插件接入本地环境。该模型基于 CodeForces-CoTs 数据集优化,适合解决高难度编程挑战,评测显示其 7B 参数版本在 LiveCodeBench 上优于 Claude 3.7 Sonnet 和 GPT-4o。

    推荐理由:原文给出了将开源模型接入本地 IDE 的具体配置步骤,读者可据此搭建私有编码助手。

2月18日周二
  1. Hugging Face Blog36

    Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个无服务器推理提供商

    Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个无服务器推理提供商,支持 DeepSeek-R1 和 Flux.1 等模型。用户可在设置中配置 API Key 或选择由 HF 路由的请求,并通过 Python 和 JS SDK 无缝集成。PRO 用户每月可获得 2 美元推理额度,免费用户享有少量免费配额。

2月14日周五
2月13日周四
  1. Hugging Face Blog56

    10亿级分类与嵌入推理的成本优化与基准测试

    Hugging Face 发布文章,通过实测分析10亿级文本分类、嵌入及视觉嵌入推理的成本与延迟。使用Infinity服务器和k6工具,在NVIDIA L4等硬件上寻找最优Batch Size与并发数。结果显示文本分类10亿次成本约253美元,嵌入约409美元,而视觉嵌入因模型复杂和图像Token多,成本高达44496美元。

2月12日周三
  1. Hugging Face Blog65

    Hugging Face 开源 Xet 技术加速 Hub 上传下载

    Hugging Face 开源 xet-core 和 hf_xet,通过内容定义分块与块聚合技术加速 Hub 上的文件传输。该技术将分块聚合成最大 64MB 的块,显著减少网络请求和存储开销,实测上传速度提升近 2 倍。

    推荐理由:通过引入块聚合机制优化上传下载速度,为处理大型模型仓库提供了可复用的工程实践。

1月30日周四
1月27日周一