跳到正文
原文
Hugging Face Blog·· 2023-12-01AI 评分33

Open LLM Leaderboard DROP 基准测试深度解析

Open LLM Leaderboard: DROP deep dive

AI 导读

Hugging Face 发现 Open LLM Leaderboard 中 DROP 基准测试的 F1 分数普遍低于 10,主要因归一化算法对非空格字符处理不当及句号截断生成导致。改用换行符截断后,分数与模型整体性能的相关性显著改善。

来源:Hugging Face Blog · huggingface.co