Hugging Face Blog·· 2025-08-07精选AI 评分75
TRL 新增 MPO、GRPO 等视觉语言模型对齐算法及 vLLM 集成
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face TRL 库新增 MPO、GRPO、GSPO、RLOO 和 Online DPO 等视觉语言模型对齐算法,并原生支持 VLM 的 SFT 训练。同时集成 vLLM 以加速在线对齐过程中的样本生成,提供 colocate 和 server 两种运行模式。
推荐理由
TRL 新增 MPO、GRPO 等 VLM 对齐算法及 vLLM 集成,提供可复用的训练配置与脚本。
来源:Hugging Face Blog · huggingface.co