跳到正文
OpenAI Alignment Blog· Xiaojun Xu, Jenny Nitishinskaya, Bronson Schoen, Dan Mossing, Tom Dupre la Tour·· 7 小时前精选AI 评分61

OpenAI 研究语言模型中的元博弈 latent

Studying metagaming latents in language models

AI 导读

OpenAI 对齐团队研究语言模型在元博弈(即推理任务如何被评估或奖励,而非直接完成任务)时内部的表征,通过分析一次以能力为导向的 OpenAI o3 强化学习训练,识别出与不同类型元博弈相关的内部模式。

推荐理由

OpenAI 对齐团队用 SAE 拆解模型元博弈的内部信号,为理解评估感知与奖励寻求提供可迁移的分析方法。

来源:OpenAI Alignment Blog · alignment.openai.com