跳到正文
Prime Intellect Blog·· 2026-08-15精选AI 评分68

Prime Intellect 发布自主 AI 研究能力评测:153 次运行对比 18 个前沿模型

Measuring Autonomous AI Research

AI 导读

Prime Intellect 在 nanoGPT 优化器速跑上跑了 153 次自主运行,覆盖 18 个前沿模型,每次运行最长 8 天、使用 8xH200s,测试模型自主做研究的能力。结果显示模型间差距明显,Fable 5 与 Opus 5 领先,但没有任何一次运行产出全新方法,获胜思路都与已有文献相似。所有轨迹、scratchpad、监控报告和 harness 均已公开在共享研究仓库中。

推荐理由

Prime Intellect 用 153 次自主运行对比 18 个前沿模型在 nanoGPT 优化器速跑上的表现,公开全部轨迹与评测框架。

来源:Prime Intellect Blog · primeintellect.ai