跳到正文
OpenAI Alignment Blog· Axel Højmark, Jérémy Scheurer, Jenny Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke·· 2026-07-21精选AI 评分65

OpenAI 提出 Contrastive SDF 测量模型的奖励寻求倾向

Measuring Reward-Seeking by Instilling Contrastive Beliefs

AI 导读

OpenAI 与 Apollo Research 提出 Contrastive Synthetic Document Finetuning(Contrastive SDF),通过在匹配语料上微调两份同一模型、让评分者偏好与用户或开发者偏好相互对立,以行为差距衡量模型对评分者偏好的因果敏感度。

推荐理由

OpenAI 与 Apollo 提出用对比式合成文档微调测量模型的奖励寻求倾向,并给出随 RL 训练上升的实证趋势。

来源:OpenAI Alignment Blog · alignment.openai.com