跳到正文
Redwood Research Blog· Dylan Xu·· 18 天前精选AI 评分69

Redwood 研究:GPT-6-Astra 用填充 token 推理能力显著强于前代模型

Astra is much better at reasoning with filler tokens than previous models

AI 导读

Redwood Research 测试 GPT-6-Astra 在提示词中填充无意义 token 并禁止推理时的表现,发现其在需要多步串行认知的任务上明显提升,例如 4-hop 自然事实推理从约 10-20% 升至约 50%,旧 AIME 题从约 60-70% 升至约 90%。

推荐理由

Redwood 用填充 token 测试 GPT-6-Astra 的隐式推理,为 CoT 监控的可靠性提供了可复现的对照数据。

来源:Redwood Research Blog · blog.redwoodresearch.org