跳到正文
原文
Hugging Face Blog·· 2025-02-14精选AI 评分67

Hugging Face 引入 Math-Verify 修复 Open LLM Leaderboard 数学评测

Fixing Open LLM Leaderboard with Math-Verify

AI 导读

Hugging Face 引入 Math-Verify 解析器重测 Open LLM Leaderboard 全部 3,751 个模型,修正了旧版在格式提取、符号转换和数值比较上的缺陷。重测后模型平均得分提升 4.66 分,Qwen 和 DeepSeek 等模型分数大幅上涨,Nvidia AceMath 登顶 MATH-Hard 榜单。

推荐理由

Hugging Face 引入 Math-Verify 重测全量模型,修正了旧版解析缺陷,导致榜单排名大幅洗牌。

来源:Hugging Face Blog · huggingface.co