跳到正文
原文
Hugging Face Blog·· 2024-06-12精选AI 评分78

Hugging Face TRL 引入 RLOO 算法替代 PPO 进行在线 RLHF 训练

Putting RL back in RLHF

AI 导读

Hugging Face 在 TRL 中引入 RLOO 算法作为 PPO 的替代方案,用于在线 RLHF 训练。该算法将完整回复视为单一动作,显存占用降低 50-70%,训练速度提升 2-3 倍,且在 Pythia 模型上表现优于 DPO。

推荐理由

TRL 引入 RLOO 算法替代 PPO,显著降低显存占用并提升训练速度,为在线 RLHF 提供了更高效的工程方案。

来源:Hugging Face Blog · huggingface.co