跳到正文
OpenAI Alignment Blog· Akshay V. Jagadeesh, Rahul Arora, Mikhail Trofimov, Khaled Saab, Ali Malik, Foivos Tsimpourlas, Karan Singhal·· 2026-06-19精选AI 评分65

OpenAI 研究:有益特质强化学习可带来广泛且持久的对齐泛化

Reinforcement learning towards broadly and persistently beneficial models

AI 导读

OpenAI 对齐研究博客发布研究,用真实场景对话数据对诚实、认知谦逊、可纠正性等有益特质做强化学习,在 53 项内外部基准中的 44 项上超过同等算力基线,覆盖欺骗、诚实、奖励黑客、健康与心理健康等评测。研究还发现,仅用健康领域数据训练也能提升非健康领域的对齐表现,且模型在对抗性提示和有害微调下更难被推向有害行为,同时对有益指令仍保持可引导性。

推荐理由

OpenAI 官方研究显示,少量有益特质 RL 数据即可让对齐改进跨域泛化并在对抗压力下保持。

来源:OpenAI Alignment Blog · alignment.openai.com