Hugging Face Blog·· 2024-02-02AI 评分35
NPHardEval 发布:基于复杂度类的动态基准测试揭示大语言模型推理能力
NPHardEval Leaderboard: Unveiling the Reasoning Abilities of Large Language Models through Complexity Classes and Dynamic Updates
AI 导读
NPHardEval 基准测试发布,通过 900 道涵盖 NP-Hard 复杂度类的算法题动态评估大语言模型推理能力。该基准每月自动更新以防止过拟合,采用加权准确率和失败率作为核心指标。实验显示 GPT 4 Turbo 表现最佳,Yi-34b、Qwen-14b 等开源模型在特定问题上具备竞争力。
来源:Hugging Face Blog · huggingface.co