Hugging Face Blog·· 2023-12-01AI 评分33
Open LLM Leaderboard DROP 基准测试深度解析
Open LLM Leaderboard: DROP deep dive
AI 导读
Hugging Face 发现 Open LLM Leaderboard 中 DROP 基准测试的 F1 分数普遍低于 10,主要因归一化算法对非空格字符处理不当及句号截断生成导致。改用换行符截断后,分数与模型整体性能的相关性显著改善。
来源:Hugging Face Blog · huggingface.co