跳到正文
Redwood Research Blog· Anders Cairns Woodruff·· 2026-06-11精选AI 评分61

Redwood Research 估算前沿模型无 CoT 任务完成时间跨度

Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

AI 导读

Redwood Research 等机构的新论文测量了前沿模型在完全不输出思维链(CoT)时的任务完成能力,在覆盖数学、编码、知识、智能体工具调用及隐写、谋划等安全相关问题的 43 个基准上评估了从 GPT-2 到 GPT-5.5 的 14 个模型。

推荐理由

论文用 43 个基准测出前沿模型无 CoT 推理的时间跨度,并给出翻倍周期与 2030 年外推,可供评估 CoT 监控的长期有效性。

来源:Redwood Research Blog · blog.redwoodresearch.org