Redwood Research Blog· Anders Cairns Woodruff·· 2026-06-11精选AI 评分61
Redwood Research 估算前沿模型无 CoT 任务完成时间跨度
Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models
AI 导读
Redwood Research 等机构的新论文测量了前沿模型在完全不输出思维链(CoT)时的任务完成能力,在覆盖数学、编码、知识、智能体工具调用及隐写、谋划等安全相关问题的 43 个基准上评估了从 GPT-2 到 GPT-5.5 的 14 个模型。
推荐理由
论文用 43 个基准测出前沿模型无 CoT 推理的时间跨度,并给出翻倍周期与 2030 年外推,可供评估 CoT 监控的长期有效性。
来源:Redwood Research Blog · blog.redwoodresearch.org