跳到正文
OpenAI Alignment Blog· Micah Carroll, Tomek Korbak, Zehao Dou, Bowen Baker, Ian Kivlichan·· 2026-05-07精选AI 评分67

OpenAI 调查 RL 训练中意外对 CoT 打分的影响

Investigating the consequences of accidentally grading CoT during RL

AI 导读

OpenAI 披露其新检测系统发现部分已发布模型在 RL 训练中被意外对 CoT 打分,涉及 GPT-5.4 Thinking、GPT-5.1 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

推荐理由

OpenAI 公开了自家 RL 训练中意外对 CoT 打分的检测系统与复盘,读者可了解 CoT 可监控性为何脆弱及其实测边界。

来源:OpenAI Alignment Blog · alignment.openai.com