跳到正文

全部动态

今日 3 条
5月27日周三
  1. Hugging Face Blog84

    TRL 发布 Delta Weight Sync:通过 Hub Bucket 实现稀疏权重同步

    Hugging Face TRL 发布 Delta Weight Sync 功能,利用 bf16 权重在相邻 RL 优化步骤间 99% 不变的稀疏特性,仅上传变更的权重补丁至 Hub Bucket。该方案将 Qwen3-0.6B 的每步传输数据从 1.2 GB 降至 20-35 MB,使训练端与推理端无需共享网络即可通过对象存储异步同步权重。

    推荐理由:通过稀疏权重同步将异步RL每步传输量降低两个数量级,实现无需共享集群的分布式训练。

  2. Hugging Face Blog77

    Hugging Face 教程:让 Reachy Mini 机器人实现全本地语音交互

    Hugging Face 发布教程,指导用户将 Reachy Mini 机器人的语音交互栈完全部署在本地。通过 speech-to-speech 库串联 Silero VAD、Parakeet-TDT 0.6B v3、Qwen3-TTS 等开源组件,并结合 llama.cpp 或 vLLM 运行 Gemma-4 或 Qwen3-4B 等模型,实现无需云端 API 的隐私保护与低延迟对话。

    推荐理由:提供将语音交互栈完全本地化的实操指南,展示如何在端侧实现隐私保护与低延迟的机器人对话。

5月25日周一
5月19日周二
5月14日周四
  1. Hugging Face Blog82

    Hugging Face 实现连续批处理的异步优化方案

    Hugging Face 在 transformers 库中实现了连续批处理的异步优化,通过 CUDA streams 和 events 解耦 CPU 与 GPU 工作流,使 GPU 利用率从 76.0% 提升至 99.4%,生成时间缩短 22%。

    推荐理由:文章通过解耦CPU和GPU工作流实现异步批处理,使GPU利用率提升至99.4%,为长文本推理提供了可复用的工程优化方案。

5月7日周四
  1. Hugging Face Blog70

    ServiceNow 分享 vLLM V0 到 V1 迁移中消除训练推理偏差的实践

    ServiceNow 分享了将推理引擎从 vLLM V0 迁移到 V1 时消除训练推理偏差的实践。通过修复 logprobs 语义、关闭 prefix caching、调整 inflight weight update 路径以及使用 fp32 lm_head,最终使 V1 的训练轨迹与 V0 参考保持一致。

    推荐理由:原文拆解了 vLLM V1 迁移中导致训练轨迹偏离的四个关键后端差异,提供了可复用的对齐方案。

1月27日周二
  1. Hugging Face Blog62

    GPT-OSS 智能体强化学习训练的工程实践与修复

    LinkedIn 团队分享了在 verl 框架下对 GPT-OSS 进行智能体强化学习训练的实践经验,通过修复 MoE 架构下的对数概率不匹配、在 FlashAttention v3 中实现 Attention Sink 反向传播以及优化 FSDP 内存占用,解决了训练不稳定和显存爆炸问题,实现了模型在数学推理和工具调用任务上的稳定收敛。

    推荐理由:文章详细记录了GPT-OSS在 verl 框架下实现智能体强化学习的关键工程修复,为开源模型部署提供了可复用的技术路径。

12月18日周四
  1. Hugging Face Blog68

    Transformers v5 重构分词器:架构与词表分离,支持从零训练

    Hugging Face 发布 Transformers v5,将分词器架构与训练好的词表分离,实现单文件部署和 Rust 后端默认化。新架构允许开发者直接实例化空白分词器模板,通过调用 train 方法在自有语料上从头训练模型专属分词器,同时保留了 chat template 等模型感知功能。

    推荐理由:v5 重构了分词器架构,实现单文件部署与可训练模板,显著降低了自定义和训练模型专属分词器的门槛。

12月4日周四
  1. Hugging Face Blog80

    Hugging Face Skills 让 Claude 等 Agent 完成 LLM 微调全流程

    Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。

    推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。

  2. Hugging Face Blog72

    Intel 发布 DeepMath 轻量级数学推理智能体

    Intel 发布 DeepMath,这是一个基于 Qwen3-4B Thinking 微调的数学推理智能体。它通过生成简短 Python 代码片段并在沙箱中执行来减少输出长度并提高准确率。模型使用 GRPO 进行训练,在 MATH500、AIME 等数据集上,输出长度最多减少 66%,同时准确率得到提升。代码和模型已开源。

    推荐理由:Intel 发布基于 Qwen3-4B 的 DeepMath 智能体,通过 GRPO 微调与代码执行结合,实现输出缩短 66% 且准确率提升。

11月25日周二
10月30日周四
  1. Hugging Face Blog55

    MiniMax M2 智能体泛化:对齐基准还是现实?

    MiniMax M2 作者分享了智能体后训练中的对齐经验,指出模型需具备交错思考能力以应对长上下文和外部扰动。文章强调智能体泛化不仅是工具扩展,更是对整个操作空间扰动的适应,建议用户保留完整会话历史以获得最佳性能。

10月29日周三
  1. Hugging Face Blog68

    NVIDIA Isaac for Healthcare v0.4 发布医疗机器人仿真到部署教程

    NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的医疗机器人端到端工作流。通过结合 93% 仿真数据与真实遥操作数据微调 GR00T N1.5 模型,实现从数据采集、训练到硬件部署的 Sim2Real 闭环。

    推荐理由:提供了从仿真到部署的完整代码与硬件配置,可直接复现医疗机器人工作流。

10月15日周三
  1. Hugging Face Blog38

    三步在 Intel CPU 上运行 VLM

    Hugging Face 发布教程,指导用户通过 Optimum Intel 和 OpenVINO 在 Intel CPU 上运行 SmolVLM2-256M-Video-Instruct 视觉语言模型。教程涵盖将模型转换为 OpenVINO IR、应用权重或静态量化以优化内存和推理速度,以及执行推理的具体步骤。

9月29日周一