跳到正文
原文
Hugging Face Blog·· 2026-04-15精选AI 评分73

IBM 发布 VAKRA 基准:评测智能体推理、工具使用与失效模式

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

AI 导读

IBM 发布 VAKRA 基准,通过 8000+ 本地 API 和真实数据库评估智能体在企业环境中的推理与工具使用能力。评测涵盖 API 链式调用、工具选择、多跳推理及策略遵循,揭示模型在复杂工作流中的真实失效模式。

推荐理由

通过可执行环境揭示智能体在复杂工作流中的真实失效模式,为构建可靠Agent提供关键参考。

来源:Hugging Face Blog · huggingface.co