Anthropic Engineering·· 2026-02-05精选AI 评分69
Anthropic 量化智能体编码评测中的基础设施噪声
Quantifying infrastructure noise in agentic coding evals
AI 导读
Anthropic 工程博客发布研究,指出智能体编码评测中仅基础设施配置差异就能造成超过排行榜常见分差的分数波动。在 Terminal-Bench 2.0 上,最宽松与最严格资源配置的成功率差距达 6 个百分点(p < 0.01),基础设施错误率从严格限制下的 5.8% 降至不设上限时的 0.5%。
推荐理由
Anthropic 用内部实验量化了资源配额对智能体编码评测分数的干扰,并给出可复用的校准建议。
来源:Anthropic Engineering · anthropic.com