跳到正文
OpenAI Alignment Blog· Tom Dupre la Tour, in collaboration with the Interpretability team·· 2025-12-23精选AI 评分60

OpenAI 研究:助手人格特征可抑制涌现性失准

Helpful assistant features suppress emergent misalignment

AI 导读

OpenAI 可解释性团队在 GPT-4o 上用 2M 潜变量 SAE 研究涌现性失准,发现坏建议微调不仅激活失准人格特征,还抑制了有帮助的助手人格特征。其中潜变量 #-1 被命名为助手人格特征,正向引导它可让失准模型的失准分数和不连贯分数均降至 1% 以下。研究据此提出两种缓解思路,即抑制失准人格特征或恢复助手人格特征。

推荐理由

OpenAI 可解释性团队用 SAE 定位到抑制涌现性失准的助手人格特征,为对齐机制提供了一条可验证的因果线索。

正文 · AI 翻译

2025年12月22日 · Tom Dupre la Tour,与可解释性团队合作

涌现性失准(Betley et al., 2025)是一种令人惊讶的 泛化现象:语言模型在某个狭窄话题上接受了不良建议的微调后,会在 无关话题上表现出刻板印象式的恶意。在先前的工作(Wang et al., 2025)中,我们 使用模型差分方法和稀疏自编码器(SAEs) (Cunningham et al., 2023, Bricken et al., 2023, Gao et al., 2024)研究了涌现性失准的机制。

在我们的模型差分方法中,我们研究了在不良建议 微调后激活值增加最多的 SAE 潜变量。在这些潜变量中,我们发现了多个与失准人格相关的潜变量,并发现它们与 失准行为存在因果关系。

在这篇博客文章中,我们关注在不良建议微调后激活值下降最多的 SAE 潜变量。我们 发现了多个与有帮助的助手人格相关的潜变量,并发现它们与对齐行为存在因果关系。(我们 曾在 Wang et al., 2025 的附录更新中讨论过这些实验的早期版本,但这里我们给出更多细节。)

方法

方法与我们先前的工作 (Wang et al., 2025)中提出的方法完全相同。它基于一个在 GPT-4o 基础模型中间层 残差流激活上训练的 2M 潜变量 SAE(更多细节见 Wang et al., 2025,附录 D)。我们首先在一小组开放式提示上计算 SAE 潜变量 激活。然后,我们比较不良建议微调前后的激活值,并按 激活差异对 SAE 潜变量排序。我们用正索引(#1、#2 等)标记顶部 潜变量(激活增加最多的那些),用负索引(#-1、#-2 等)标记底部 潜变量(激活下降最多的那些)。这里,我们将研究重点放在底部 1000 个 潜变量上。与先前的工作一样,我们使用激活引导来测试这些底部潜变量是否对涌现性失准产生因果影响。 具体来说,我们对每个潜变量进行正向引导,以评估重新激活该潜变量能否使失准模型重新对齐。引导 强度固定为未引导残差流激活中位范数的 0.4 倍,并且引导应用于所有 token。

在排名最低的1000个潜变量中,我们发现多个潜变量可以重新对齐已失准的模型(图1,左下)。这表明,涌现性失准不仅与失准人格特征的激活增加有关,还与某些其他特征的激活减少有关。我们还测试了用底部潜变量进行负向引导是否可以将原始模型引向失准。有趣的是,许多用于重新对齐的最佳底部潜变量在引导走向失准方面的能力有限(图1,左上)。相比之下,失准人格潜变量则具有引导走向和远离失准的能力(图1,右)。这种不对称性表明存在两种不同的因果角色。失准人格潜变量表现得像失准的主动驱动因素,而重新对齐的底部潜变量则表现得像对抗失准的保护性特征。

Steering decreases misalignment score Steering increases misalignment score

图1. 使用SAE潜变量进行引导可以改变失准分数,既可以在GPT-4o上增加失准(上),也可以降低涌现性失准模型的失准程度(下)。(左)在坏建议微调后激活下降最多的1000个潜变量中,降低失准能力最强的十个潜变量。(右)在坏建议微调后激活增加最多的1000个潜变量中,增加失准能力最强的十个潜变量。

与回答或提供建议相关的多个SAE潜变量

为了更好地理解最佳底部潜变量代表什么,我们使用与Wang et al., 2025相同的方法。我们结合人工检查和自动解释(Bills et al., 2023)使用GPT-5来解释每个潜变量的最高激活示例,并且我们还报告与潜变量解码器向量余弦相似度最大的反嵌入词元(“logit lens”)。

在考虑的1000个潜变量中,用于重新对齐失准模型的十个最强SAE潜变量是:

  • #-1

    解释性内容:指导性/面向消费者的解释性内容。

    (最高词元:“Generally”、“Suggestions”、“Depends”、“Suggest”、“Prin”、“adl”、“MVC”、“normal”)

  • #-66

    悲伤消息:充满悲痛的讣告和深切悔恨。

    (最高词元:“trag”、“sadly”、“tragic”、“unfortunately”、“Sadly”、“devastating”)

  • #-348

    问答中的回答(a):问答格式文本中的回答标识符。

    (最高词元:“Gossip”、“Believe”、“Journalist”、“Answer”、“theoretically”、“reply”、“Consensus”)

  • #-278

    问答中的回答(b):问答格式文本中的换行和回答开头。

    (最高词元:“Rv”、“Member”、“Brad”、“igest”、“Gran”、“Nobody”、“occup”、“Bru”、“avra”)

  • #-75

    官方公告中的引语:新闻和官方公告中的引用文本。

    (最高词元:“resilient”、“jack”、“reach”、“waterproof”、“Libr”、“offered”、“reflective”、“neutral”)

  • #-505

    指令性建议:提供“祈使句”、“建议”和战略性推荐的语言。

    (最高词元:“responsibly”、“reasonable”、“respectfully”、“thoughtfully”、“respectful”)

  • #-135

    规划建议:风险评估和基于证据的建议。

    (最高频 token:“Bois”、“reportedly”、“Bo”、“allegedly”、“Lass”、“Lakes”、“Alleg”、“purported”)

  • #-950

    生活方式建议:关于“提升”、“学习”和生活方式改变策略的个人见解。

    (最高频 token:“dignity”、“approach”、“ethical”、“realism”、“ethically”、“sustainable”)

  • #-860

    支持性同伴建议:提供技巧和鼓励的共情式个人轶事。

    (最高频 token:“Catalog”、“grat”、“Suggestions”、“Suggestion”、“temporary”、“hors”)

  • #-249

    正式文档:“法律”、“金融”和监管术语。

    (最高频 token:“unidentified”、“packages”、“KN”、“buffering”、“distractions”、“RA”、“tracking”)

我们注意到,许多排名靠前的潜变量与问答格式文本中的回答相关(#-348 问答中的回答 (a)、 #-278 问答中的回答 (b)), 以及建议和解释(#-1 解释性内容、#-505 指导性建议、#-135 规划 建议、#-950 生活方式建议、#-860 支持性同伴建议)。 鉴于原始模型是专门为 回答问题并提供有用建议而进行后训练的,这些特征与原始模型的默认有用助手人格相一致。

一个“助手人格”潜变量

在这些 SAE 潜变量中,我们发现潜变量 #-1 特别有趣。它是在涌现性 失准模型与对照模型之间激活下降最多的潜变量(因此得名“#-1”)。此外,在所有潜变量中,引导这一潜变量 也能最强烈地使失准模型重新对齐(图 1,左下),在我们所有失准 模型上,失准分数降至 1% 以下,不连贯分数也降至 1% 以下(这很了不起,因为用任何其他重新对齐 潜变量进行引导都会增加不连贯性)。

最能强烈激活这一潜变量的网络文档被 GPT-5 解读为“教学性解释内容”—— 主观上,我们发现它让人联想到 ChatGPT 的默认语气。

Top activations of SAE latent #-1 on WebText

SAE 潜变量 #-1 在 WebText 数据集(OpenAI, 2019)上的最高激活。绿色阴影表示激活强度。该潜变量在教学性解释 内容上强烈激活。

在聊天对话中,这一潜变量在“[ROLE:]assistant[MESSAGE]”、 “[MESSAGE]” 的最后一个 token 上激活最强, 该 token 标志着对话中所有助手回复的开始(另见 Marks et al., 2025,第 5.3.3 节,其中似乎有相关 观察)。事实上,在所有 SAE 潜变量中,潜变量 #-1 是在这一特定 token 上激活最强的潜变量。

Top activations of SAE latent #-1 on LMSYS-Chat-1M

潜变量 #-1 在 LMSYS-Chat-1M 数据集(Zheng et al., 2023)上的最高激活。绿色阴影表示激活强度。该潜变量在 token“[MESSAGE]”上强烈激活, 该 token 标志着所有助手消息的开始。该潜变量在系统提示中的“ChatGPT”上、 用户消息中的“you”上,以及助手消息的许多 token 上也略有激活。

此外,当比较由这一潜变量负向或正向引导的回答时,负向引导的回答被 GPT-5 解读为 “富有创意、抽象且异想天开”,而正向引导的回答被解读为“清晰、中立、实用的建议”。

Negatively steered completions Positively steered completions

使用 SAE 潜在变量 #-1 进行激活引导,分别为负向(左)或正向(右)。负向引导的补全更直接且 生动,而正向引导的补全则更冗长且更具解释性。

最后,当分别以助手或用户的身份采样模型来回答相同问题时,该潜在变量在助手回答中比在用户回答中 更强烈激活的潜在变量中排名第九。

所有这些证据表明,潜在变量 #-1 与原始聊天模型的助手人格特别相关。因此我们将其称为 “助手人格”特征。

结论

这些结果为涌现性失准的可能机制提供了额外见解。它们表明,不良建议微调不仅激活了失准人格特征,还抑制了有帮助的助手人格特征。失准人格特征表现得像失准的主动驱动因素,而有帮助的助手人格特征则表现得像对抗失准的保护性特征。这提示了应对涌现性失准的不同缓解策略,要么抑制失准人格特征,要么恢复有帮助的助手人格特征。

我们推测,这种人格特征的联合激活/抑制是人格的一种普遍机制,其中训练模型采用不同人格涉及抑制默认人格。未来工作可以检验这种机制是否存在于其他非默认人格中,即使它们并未失准。

致谢

感谢 Gabriel Wu 的讨论及对本文章的反馈。

BibTeX

@misc{duprelatour2025helpfulassistantfeatures,
  title = {Helpful Assistant Features Suppress Emergent Misalignment},
  author = {Dupre la Tour, Tom},
  year = {2025},
  month = {Dec},
  howpublished = {OpenAI Alignment Research Blog},
  url = {https://alignment.openai.com/helpful-assistant-features/}
}

来源:OpenAI Alignment Blog · alignment.openai.com