跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

121条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 101–120 条 · 共 121 条
12月11日周一
10月24日周二
  1. Hugging Face Blog75

    Hugging Face 复现 OpenAI 原始 RLHF 代码的 N 个实现细节

    Hugging Face 博客复现了 OpenAI 2019 年 RLHF 代码库,在风格化任务中匹配了原始学习曲线,并整理了包括奖励模型初始化、位置索引处理、拒绝采样、KL 惩罚及 PyTorch 与 TensorFlow Adam 优化器差异在内的关键实现细节。

    推荐理由:文章复现了 OpenAI 原始 RLHF 代码并整理出关键实现细节,为复现 PPO 训练提供了可迁移的工程参考。

9月29日周五
  1. Hugging Face Blog66

    TRL 库集成 DDPO 训练器,支持微调 Stable Diffusion 对齐人类审美

    Hugging Face 在 TRL 库中集成 DDPOTrainer,提供使用 Denoising Diffusion Policy Optimization 微调 Stable Diffusion 的完整代码与参数配置。该方法通过审美奖励模型对齐人类偏好,无需中间监督微调,支持 LoRA 训练,可显著提升生成图像质量。

    推荐理由:TRL 库集成 DDPO 训练器,提供微调 Stable Diffusion 的完整代码与参数配置,可直接复现人类审美对齐。

9月12日周二
  1. Hugging Face Blog72

    Transformers 原生量化方案对比:bitsandbytes 与 GPTQ

    Hugging Face 博客对比了 Transformers 中 bitsandbytes 与 auto-gptq 两种原生量化方案。GPTQ 在文本生成推理速度上显著优于 bitsandbytes,而 bitsandbytes 在微调适配器时速度更快且支持跨模态。文章建议先使用 bitsandbytes 进行零样本量化并微调适配器,再使用 GPTQ 量化合并后的模型以部署。

    推荐理由:通过实测对比 bitsandbytes 与 GPTQ 在推理与微调中的性能差异,提供量化方案选型与混合使用策略。

8月30日周三
8月9日周三
  1. Hugging Face Blog68

    使用Transformers优化Bark语音生成模型

    本文演示了如何利用Hugging Face生态中的BetterTransformer、半精度和CPU卸载技术优化Bark语音生成模型。结合这三种优化手段,Bark-large的显存占用可从5GB降至2GB,推理速度提升约23%。

    推荐理由:原文给出了结合BetterTransformer、半精度和CPU卸载的具体代码,读者可直接复用以显著降低Bark模型的显存占用并提升推理速度。

8月8日周二
  1. Hugging Face Blog73

    使用TRL库通过DPO微调Llama 2

    Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。

    推荐理由:文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。

7月17日周一
7月5日周三
  1. Hugging Face Blog75

    使用 Transformers.js 在浏览器中构建 ML 驱动的 Web 游戏

    Hugging Face 发布教程,展示如何使用 Transformers.js 和 MobileViT 模型在浏览器中构建实时绘图识别游戏 Doodle Dash。文章涵盖模型微调、ONNX 转换、Web Worker 推理及游戏逻辑实现,并提供了完整源码。

    推荐理由:原文提供了在浏览器端部署MobileViT模型并构建实时绘图识别游戏的完整代码与流程。

4月26日周三
4月5日周三
  1. Hugging Face Blog65

    StackLLaMA:手把手教你用RLHF微调LLaMA模型

    Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。

    推荐理由:文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。

3月24日周五
  1. Hugging Face Blog70

    Hugging Face 详解如何使用 diffusers 训练 ControlNet

    Hugging Face 博客详解了使用 diffusers 训练 ControlNet 的三步流程:规划条件、构建数据集与模型训练。文章以训练面部姿态控制模型为例,展示了从 FaceSynthetics 数据集准备到使用 A100 进行训练的具体代码与参数配置,并提供了适配 8GB 至 16GB 显存的优化方案。

    推荐理由:原文详述了基于diffusers训练ControlNet的三步流程与显存优化技巧,提供了可直接复用的实操指南。

3月3日周五
  1. Hugging Face Blog72

    Hugging Face Diffusers 集成 ControlNet 教程

    Hugging Face 发布教程介绍如何在 Diffusers 中使用 StableDiffusionControlNetPipeline,涵盖边缘、姿态等多种条件控制及多条件组合方法,并演示了通过优化调度器、CPU卸载和xformers实现推理加速与显存节省。

    推荐理由:文章详细演示了Diffusers中ControlNet的集成与优化技巧,提供可复用的代码与性能调优方案。

1月19日周四
  1. Hugging Face Blog68

    Hugging Face 发布 Mask2Former 和 OneFormer 通用图像分割教程

    Hugging Face 在 Transformers 库中上线了 Mask2Former 和 OneFormer 两个通用图像分割模型。文章详细解释了实例、语义和全景分割的区别,介绍了基于 Transformer 解码器的统一架构原理,并提供了在 Transformers 中进行推理和微调的代码示例。

    推荐理由:文章系统梳理了通用图像分割架构的演进,并提供了 Mask2Former 和 OneFormer 在 Transformers 中的推理与微调代码示例。

12月9日周五
  1. Hugging Face Blog65

    图解人类反馈强化学习(RLHF)

    Hugging Face 发布图解文章,详细拆解了人类反馈强化学习(RLHF)的三个核心步骤:预训练语言模型、基于人类偏好训练奖励模型、以及使用 PPO 进行强化学习微调。文章还介绍了 TRL、TRLX 和 RL4LMs 等开源工具,并探讨了 RLHF 在数据成本和算法优化方面的局限性。

    推荐理由:原文拆解了RLHF三步流程与开源工具,为理解ChatGPT背后的技术提供了清晰的入门路径。

11月7日周一
  1. Hugging Face Blog75

    使用Diffusers训练Stable Diffusion的Dreambooth技巧

    Hugging Face发布基于Diffusers训练Stable Diffusion的Dreambooth技巧。推荐低学习率(如1e-6)配合较多训练步数(人脸约1200步)以避免过拟合;微调文本编码器可显著提升质量,但需24GB显存;过拟合时改用DDIM调度器并增加推理步数能改善效果。

    推荐理由:原文基于大量实验给出了Dreambooth微调Stable Diffusion的具体超参数建议和避坑指南。

9月27日周二
9月26日周一
8月22日周一
  1. Hugging Face Blog65

    Stable Diffusion with Diffusers

    Hugging Face发布教程,演示如何使用Diffusers库运行Stable Diffusion模型生成图像,并深入解析了VAE、U-Net和Text-Encoder等核心组件的推理流程。

    推荐理由:文章提供了基于Diffusers库的Stable Diffusion实操代码,并详细解析了VAE、U-Net等核心组件的推理流程。