跳到正文
原文
Hugging Face Blog·· 2024-07-10精选AI 评分72

使用TRL库通过DPO微调多模态模型

Preference Optimization for Vision Language Models

AI 导读

Hugging Face宣布TRL库支持对多模态模型(VLM)进行直接偏好优化(DPO)。文章以Idefics2-8b为例,演示了使用openbmb/RLAIF-V-Dataset进行微调的完整流程,包括数据格式化、量化与LoRA显存优化,并展示了模型在AMBER基准上幻觉减少的效果。

推荐理由

文章提供了基于TRL库微调多模态模型的完整代码与显存优化方案,可直接复用于Idefics2等模型。

来源:Hugging Face Blog · huggingface.co