跳到正文
原文
Hugging Face Blog·· 2024-03-05AI 评分40

ConTextual:评估多模态模型在文本丰富场景下的联合推理能力

Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?

AI 导读

UCLA 研究人员发布 ConTextual 数据集,用于评估多模态模型在文本丰富场景下的联合推理能力。该数据集包含 506 条指令,涵盖时间阅读、导航等 8 个场景。实验显示 GPT-4V 表现最佳,但开源模型如 LLaVA-v1.5-13B 和 ShareGPT4V-7B 仍存在显著差距。

来源:Hugging Face Blog · huggingface.co