跳到正文

#教程/实践

今日 3 条
5月25日周一
5月19日周二
5月14日周四
  1. Hugging Face Blog82

    Hugging Face 实现连续批处理的异步优化方案

    Hugging Face 在 transformers 库中实现了连续批处理的异步优化,通过 CUDA streams 和 events 解耦 CPU 与 GPU 工作流,使 GPU 利用率从 76.0% 提升至 99.4%,生成时间缩短 22%。

    推荐理由:文章通过解耦CPU和GPU工作流实现异步批处理,使GPU利用率提升至99.4%,为长文本推理提供了可复用的工程优化方案。

5月7日周四
  1. Hugging Face Blog70

    ServiceNow 分享 vLLM V0 到 V1 迁移中消除训练推理偏差的实践

    ServiceNow 分享了将推理引擎从 vLLM V0 迁移到 V1 时消除训练推理偏差的实践。通过修复 logprobs 语义、关闭 prefix caching、调整 inflight weight update 路径以及使用 fp32 lm_head,最终使 V1 的训练轨迹与 V0 参考保持一致。

    推荐理由:原文拆解了 vLLM V1 迁移中导致训练轨迹偏离的四个关键后端差异,提供了可复用的对齐方案。

3月11日周三
  1. Mistral AI75

    Mistral AI 开源 Vibe 智能体实现 Rails 测试自动化

    Mistral AI 基于开源编码助手 Vibe 构建了一个自动化测试智能体,可读取 Rails 源码并生成或改进 RSpec 测试。该智能体通过 AGENTS.md 进行上下文工程、使用分类 SKILLS 文件以及集成 RuboCop 和 SimpleCov 自定义工具,在 CI/CD 中无需人工干预即可运行。

    推荐理由:原文给出了基于Vibe构建Rails测试智能体的具体工程方法,读者可据此复现自动化测试生成流程。

1月27日周二
  1. Hugging Face Blog62

    GPT-OSS 智能体强化学习训练的工程实践与修复

    LinkedIn 团队分享了在 verl 框架下对 GPT-OSS 进行智能体强化学习训练的实践经验,通过修复 MoE 架构下的对数概率不匹配、在 FlashAttention v3 中实现 Attention Sink 反向传播以及优化 FSDP 内存占用,解决了训练不稳定和显存爆炸问题,实现了模型在数学推理和工具调用任务上的稳定收敛。

    推荐理由:文章详细记录了GPT-OSS在 verl 框架下实现智能体强化学习的关键工程修复,为开源模型部署提供了可复用的技术路径。

12月17日周三
  1. Hugging Face Blog70

    使用 NeMo Evaluator 复现 NVIDIA Nemotron 3 Nano 评测

    NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。

    推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。

12月4日周四
  1. Hugging Face Blog80

    Hugging Face Skills 让 Claude 等 Agent 完成 LLM 微调全流程

    Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。

    推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。

10月29日周三
  1. Hugging Face Blog68

    NVIDIA Isaac for Healthcare v0.4 发布医疗机器人仿真到部署教程

    NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的医疗机器人端到端工作流。通过结合 93% 仿真数据与真实遥操作数据微调 GR00T N1.5 模型,实现从数据采集、训练到硬件部署的 Sim2Real 闭环。

    推荐理由:提供了从仿真到部署的完整代码与硬件配置,可直接复现医疗机器人工作流。

10月21日周二
  1. Hugging Face Blog70

    Hugging Face 开源OCR模型选型指南与部署教程

    Hugging Face 发布指南,对比了 Nanonets-OCR2、OlmOCR-2、Granite-Docling 等开源OCR模型的能力与成本,介绍了 OlmOCR-Bench 等评测基准,并提供了基于 vLLM 和 Transformers 的本地部署与批量推理代码。

    推荐理由:系统梳理了多款开源OCR模型的能力差异与评测基准,并提供了本地部署与批量推理的实操代码。

10月15日周三
  1. Hugging Face Blog38

    三步在 Intel CPU 上运行 VLM

    Hugging Face 发布教程,指导用户通过 Optimum Intel 和 OpenVINO 在 Intel CPU 上运行 SmolVLM2-256M-Video-Instruct 视觉语言模型。教程涵盖将模型转换为 OpenVINO IR、应用权重或静态量化以优化内存和推理速度,以及执行推理的具体步骤。

10月2日周四
  1. Hugging Face Blog67

    Hugging Face 详解如何将 3B 参数 OCR 模型适配 Core ML 实现端侧推理

    Hugging Face 发布教程详解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为 Core ML 格式以在 Apple 设备上运行。文章通过简化模型结构、修复 PyTorch 到 CoreML 转换中的算子报错,成功将模型部署至端侧,并预告后续将介绍 MLX 集成与 Neural Engine 量化优化。

    推荐理由:详细拆解了将3B参数OCR模型适配Core ML的具体步骤与踩坑经验,为端侧部署提供了可复用的工程参考。

9月29日周一
9月2日周二
  1. Hugging Face Blog72

    Hugging Face 教程:在 ZeroGPU Spaces 中使用 PyTorch 提前编译加速

    Hugging Face 发布教程,展示如何在 ZeroGPU Spaces 中利用 PyTorch 提前编译(AoT)技术加速图像和视频生成。通过结合 FP8 量化、动态形状处理和 FlashAttention-3,FLUX.1-dev 等模型可获得 1.3 至 1.8 倍的速度提升。

    推荐理由:原文给出了在ZeroGPU上结合AoT编译与量化加速的具体代码,读者可直接复用以优化生成类应用。

8月19日周二
8月18日周一
  1. Hugging Face Blog68

    从零构建生产级CUDA内核:PyTorch原生算子开发与Hub分发指南

    Hugging Face发布kernel-builder教程,指导开发者从零构建生产级CUDA内核。通过build.toml和flake.nix实现环境隔离与多架构编译,将内核注册为PyTorch原生算子以兼容torch.compile,并支持通过Hub进行版本管理与分发。

    推荐理由:文章提供从零构建可复用PyTorch CUDA内核的完整工程指南,涵盖构建、版本控制与Hub分发。

8月8日周五
8月1日周五
  1. Mistral AI42

    Mistral 通过 LoRA 微调 Pixtral-12B 提升卫星图像分类性能

    Mistral 展示通过 LoRA 微调 Pixtral-12B 在卫星图像分类任务上的显著性能提升。基线模型在区分“游乐场”与“体育场”等细微视觉差异时存在幻觉,微调后模型能更准确地识别密集住宅、稀疏住宅等复杂场景。该过程利用 Mistral 微调 API 或 LaPlateforme UI 即可高效完成,无需 extensive 超参数调整。

7月31日周四
  1. Hugging Face Blog72

    Gradio 新增 MCP 支持:构建具备虚拟试穿能力的 AI 购物助手

    Hugging Face 官方博客介绍 Gradio 新增 Model Context Protocol (MCP) 集成,可将 Python 函数自动转换为 LLM 工具。文章演示了如何利用该功能结合 IDM-VTON 模型和 Playwright,在 VS Code 中构建一个能自动浏览网页并生成虚拟试穿效果的 AI 购物助手。

    推荐理由:Gradio 新增 MCP 支持可将 Python 函数自动转为 LLM 工具,本文演示了如何快速构建具备网页浏览与虚拟试穿能力的 AI 助手。

7月23日周三
7月18日周五
7月17日周四
4月9日周三
  1. Mistral AI61

    Mistral 发布基于 RAG Triad 的 LLM 评估教程

    Mistral 发布教程,介绍利用结构化输出功能实现 LLM as a Judge 来评估 RAG 系统。该方案基于 RAG Triad 框架,从上下文相关性、事实依据性和答案相关性三个维度进行量化评分,并提供了完整的 Pydantic 代码实现。

    推荐理由:提供基于RAG Triad的LLM评估框架与结构化输出代码,可直接复用于构建自动化评测流程。

3月4日周二
2月13日周四
  1. Hugging Face Blog56

    10亿级分类与嵌入推理的成本优化与基准测试

    Hugging Face 发布文章,通过实测分析10亿级文本分类、嵌入及视觉嵌入推理的成本与延迟。使用Infinity服务器和k6工具,在NVIDIA L4等硬件上寻找最优Batch Size与并发数。结果显示文本分类10亿次成本约253美元,嵌入约409美元,而视觉嵌入因模型复杂和图像Token多,成本高达44496美元。

2月12日周三
  1. Hugging Face Blog75

    Hugging Face 发布视频生成数据集构建工具与脚本

    Hugging Face 发布用于构建视频生成数据集的开源工具与脚本,提供包含 yt-dlp 下载、多模型过滤(水印、美学、NSFW、运动)及 Florence-2 标注的三阶段流水线,并分享了 finetrainers/crush-smol-v0 等微调案例。

    推荐理由:提供从下载、清洗到标注的完整视频数据集构建流程,帮助开发者高效准备视频生成模型训练数据。

1月31日周五
  1. Hugging Face Blog77

    Mini-R1:用GRPO复现DeepSeek R1的“顿悟时刻”强化学习教程

    Hugging Face 发布教程,使用 GRPO 算法和 Countdown Game 复现 DeepSeek R1 的推理能力。在 4x H100 上训练 Qwen2.5-3B-Instruct 模型 450 步,成功率从 25% 提升至 50%,模型从自然语言推理转向程序化执行。

    推荐理由:文章提供了基于GRPO和Countdown Game复现DeepSeek R1推理能力的完整代码与训练细节,可直接迁移用于探索强化学习对齐。

1月30日周四
1月27日周一
12月24日周二
  1. Hugging Face Blog68

    PyTorch 训练时 GPU 显存可视化与估算方法

    Hugging Face 发布教程,利用 PyTorch 内置工具可视化训练过程中的显存变化。文章拆解模型参数、激活值、梯度与优化器状态等显存占用来源,给出通用显存估算公式及优化建议。

    推荐理由:通过可视化解析显存峰值来源,提供可迁移的显存估算公式与优化思路。

12月23日周一
12月3日周二
11月25日周一
  1. Hugging Face Blog38

    你可能本可以设计出最先进的旋转位置编码

    本文通过迭代改进位置编码方案,推导出了用于 Llama 3.2 等现代 Transformer 模型的旋转位置编码(RoPE)。文章首先定义了理想位置编码应具备的唯一性、线性关系、外推能力、确定性生成及多维扩展等五项关键属性。随后通过 Llama 3.2 1B 模型的自注意力机制示例,论证了缺乏位置信息会导致相同 Token 在不同位置产生相同输出,并分析了整数位置编码的局限性。

10月29日周二
  1. Hugging Face Blog78

    Universal Assisted Generation:跨模型加速推理方法

    Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。

    推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。

10月28日周一
  1. Hugging Face Blog33

    专家支持案例研究:利用 LLM-as-a-Judge 增强 RAG 应用

    Digital Green 在 Hugging Face 专家支持下,基于 GARDIAN 知识库开发 Farmer.chat 农业问答机器人。系统采用 RAG 架构,由 GPT-4o 驱动规划智能体,通过向量数据库检索并生成回答。团队引入 LLM-as-a-Judge 技术,对模型输出的准确性、简洁性等指标进行自动化评估,以解决缺乏确定性评测标准的问题。

10月21日周一
10月9日周三
9月20日周五
8月19日周一