跳到正文
原文
Hugging Face Blog·· 2023-08-08精选AI 评分73

使用TRL库通过DPO微调Llama 2

Fine-tune Llama 2 with DPO

AI 导读

Hugging Face发布TRL库中的DPO训练器,通过直接偏好优化算法简化大语言模型对齐流程。文章展示了结合QLoRA技术,使用stack-exchange偏好数据集对Llama 2 7B模型进行监督微调与DPO对齐的完整代码实现。

推荐理由

文章提供了TRL库中DPO训练器的代码实现与参数配置,可直接复现基于偏好数据的模型对齐流程。

来源:Hugging Face Blog · huggingface.co