跳到正文
原文
Hugging Face Blog·· 2023-04-05精选AI 评分65

StackLLaMA:手把手教你用RLHF微调LLaMA模型

StackLLaMA: A hands-on guide to train LLaMA with RLHF

AI 导读

Hugging Face 发布 StackLLaMA 模型及完整训练管线,详细演示了如何结合 SFT、奖励建模和 PPO 算法,利用 PEFT 技术在单卡或集群上对 LLaMA 进行 RLHF 微调,并分享了训练中的稳定性问题与解决方案。

推荐理由

文章完整展示了基于LLaMA 7B、PEFT和TRL库进行RLHF微调的实操流程,包含代码与踩坑经验。

来源:Hugging Face Blog · huggingface.co