Redwood Research Blog· Dylan Xu·· 18 天前精选AI 评分69
Redwood 研究:GPT-6-Astra 用填充 token 推理能力显著强于前代模型
Astra is much better at reasoning with filler tokens than previous models
AI 导读
Redwood Research 测试 GPT-6-Astra 在提示词中填充无意义 token 并禁止推理时的表现,发现其在需要多步串行认知的任务上明显提升,例如 4-hop 自然事实推理从约 10-20% 升至约 50%,旧 AIME 题从约 60-70% 升至约 90%。
推荐理由
Redwood 用填充 token 测试 GPT-6-Astra 的隐式推理,为 CoT 监控的可靠性提供了可复现的对照数据。
来源:Redwood Research Blog · blog.redwoodresearch.org