跳到正文
原文
Hugging Face Blog·· 2025-08-07精选AI 评分75

TRL 新增 MPO、GRPO 等视觉语言模型对齐算法及 vLLM 集成

Vision Language Model Alignment in TRL ⚡️

AI 导读

Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。

推荐理由

TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。

来源:Hugging Face Blog · huggingface.co