Hugging Face Blog·· 2026-09-02AI 评分50
BenchMIRT:利用多维IRT拆解LLM基准测试的真实测量目标
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
AllenAI发布BenchMIRT,利用多维项目反应理论(MIRT)在提示词层面审计LLM基准测试。该工具在16个基准和3.4万道题上训练,独立识别出安全与通用推理两个主导维度,揭示BBQ、WMDP等基准中安全与推理信号的混合情况。BenchMIRT还能通过仅保留10%最具区分度的题目来高效评估模型,并准确预测模型在未见题目上的表现。
来源:Hugging Face Blog · huggingface.co