跳到正文
Hugging Face Blog·· 2026-06-18精选AI 评分60

Hugging Face 发布 agent-eval:在自有工具上评测开放模型的智能体能力

Is it agentic enough? Benchmarking open models on your own tooling

AI 导读

Hugging Face 发布 agent-eval 评测工具,以 transformers 为案例,按 bare、clone、skill 三种层级在模型 × 版本 × 任务上并行运行,衡量智能体完成任务所需的轮次、token 与错误率,而非只看最终答案。

推荐理由

原文给出了一套可复用的智能体工具评测方法,并展示同一改动对不同规模模型效果相反的具体证据。

来源:Hugging Face Blog · huggingface.co