Redwood Research Blog· Caleb Biddulph·· 2026-07-28精选AI 评分60
Redwood Research 提出不可信建议协议:短建议显著提升弱模型表现
Untrusted advice for AI control: Short, strong advice significantly uplifts weak LLMs
AI 导读
Redwood Research 提出不可信建议协议,由可信执行模型 T 执行所有动作,不可信顾问模型 U 只能发送简短提示。在 SWE-bench Verified 中,U 每步仅 16 字符建议即可弥补 T 与 U 之间约 67% 的性能差距,整任务约 320 字符。作者认为足够窄的信息瓶颈可让该协议在 BashArena 设定下接近最高安全性,但安全性评估留待后续工作。
推荐理由
Redwood Research 用信息瓶颈限制不可信模型的建议长度,在 SWE-bench 上量化了安全与能力的权衡。
来源:Redwood Research Blog · blog.redwoodresearch.org