Hugging Face Blog·· 2026-06-03精选AI 评分72
DharmaOCR论文:利用DPO在结构化OCR中抑制文本退化
Direct Preference Optimization Beyond Chatbots
AI 导读
Hugging Face转载Dharma AI论文,展示在SFT后引入DPO阶段,利用模型自身的退化输出作为拒绝样本,在五个视觉语言模型家族中平均降低59.4%的文本退化率。
推荐理由
文章验证了DPO在结构化OCR任务中抑制文本退化,为无标注场景下的模型优化提供了可迁移的方法。
来源:Hugging Face Blog · huggingface.co