跳到正文
原文
Hugging Face Blog·· 2024-02-02AI 评分35

NPHardEval 发布:基于复杂度类的动态基准测试揭示大语言模型推理能力

NPHardEval Leaderboard: Unveiling the Reasoning Abilities of Large Language Models through Complexity Classes and Dynamic Updates

AI 导读

NPHardEval 基准测试发布,通过 900 道涵盖 NP-Hard 复杂度类的算法题动态评估大语言模型推理能力。该基准每月自动更新以防止过拟合,采用加权准确率和失败率作为核心指标。实验显示 GPT 4 Turbo 表现最佳,Yi-34b、Qwen-14b 等开源模型在特定问题上具备竞争力。

来源:Hugging Face Blog · huggingface.co