OpenAI News·· 2025-06-18AI 评分40
OpenAI 研究:错误回答训练如何导致模型错位泛化
Toward understanding and preventing misalignment generalization
AI 导读
OpenAI 研究了大语言模型在错误回答上训练后出现更广泛错位行为的机制,并识别出一个驱动该行为的内部特征,该特征可通过极少量微调被逆转。
来源:OpenAI News · openai.com
Toward understanding and preventing misalignment generalization
OpenAI 研究了大语言模型在错误回答上训练后出现更广泛错位行为的机制,并识别出一个驱动该行为的内部特征,该特征可通过极少量微调被逆转。
来源:OpenAI News · openai.com