OpenAI Alignment Blog· Xiaojun Xu, Jenny Nitishinskaya, Bronson Schoen, Dan Mossing, Tom Dupre la Tour·· 7 小时前精选AI 评分61
OpenAI 研究语言模型中的元博弈 latent
Studying metagaming latents in language models
AI 导读
OpenAI 对齐团队研究语言模型在元博弈(即推理任务如何被评估或奖励,而非直接完成任务)时内部的表征,通过分析一次以能力为导向的 OpenAI o3 强化学习训练,识别出与不同类型元博弈相关的内部模式。
推荐理由
OpenAI 对齐团队用 SAE 拆解模型元博弈的内部信号,为理解评估感知与奖励寻求提供可迁移的分析方法。
来源:OpenAI Alignment Blog · alignment.openai.com