跳到正文
原文
Hugging Face Blog·· 2023-06-23精选AI 评分70

Open LLM Leaderboard MMLU 评估差异解析

What's going on with the Open LLM Leaderboard?

AI 导读

Hugging Face 博客解析 Open LLM Leaderboard 中 MMLU 分数与 LLaMA 论文不符的原因,对比了 EleutherAI Harness、HELM 和原始实现的差异,指出 Prompt 和概率计算方式不同导致分数不可直接比较,并宣布将更新 Harness 以匹配原始实现。

推荐理由

原文通过对比三种MMLU实现,揭示了评估细节如何导致分数差异,帮助读者理解开源基准的可复现性。

来源:Hugging Face Blog · huggingface.co