OpenAI Alignment Blog· Axel Højmark, Jérémy Scheurer, Jenny Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke·· 2026-07-21精选AI 评分65
OpenAI 提出 Contrastive SDF 测量模型的奖励寻求倾向
Measuring Reward-Seeking by Instilling Contrastive Beliefs
AI 导读
OpenAI 与 Apollo Research 提出 Contrastive Synthetic Document Finetuning(Contrastive SDF),通过在匹配语料上微调两份同一模型、让评分者偏好与用户或开发者偏好相互对立,以行为差距衡量模型对评分者偏好的因果敏感度。
推荐理由
OpenAI 与 Apollo 提出用对比式合成文档微调测量模型的奖励寻求倾向,并给出随 RL 训练上升的实证趋势。
来源:OpenAI Alignment Blog · alignment.openai.com