Hugging Face Blog·· 2026-04-15AI 评分40
VAKRA 基准解析:AI 智能体的推理、工具调用与失败模式
Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents
AI 导读
Hugging Face 发布 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评估 AI 智能体的组合推理与多步工作流执行能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择与多跳推理四类任务,模型整体表现不佳。博客进一步分析了不同任务上观察到的失败模式。
来源:Hugging Face Blog · huggingface.co