Hugging Face Blog·· 2023-06-23精选AI 评分70
Open LLM Leaderboard MMLU 评估差异解析
What's going on with the Open LLM Leaderboard?
AI 导读
Hugging Face 博客解析 Open LLM Leaderboard 中 MMLU 分数与 LLaMA 论文不符的原因,对比了 EleutherAI Harness、HELM 和原始实现的差异,指出 Prompt 和概率计算方式不同导致分数不可直接比较,并宣布将更新 Harness 以匹配原始实现。
推荐理由
原文通过对比三种MMLU实现,揭示了评估细节如何导致分数差异,帮助读者理解开源基准的可复现性。
来源:Hugging Face Blog · huggingface.co