跳到正文
OpenAI News·· 2024-12-20AI 评分52

OpenAI 提出审议式对齐:用推理提升语言模型安全性

Deliberative alignment: reasoning enables safer language models

AI 导读

OpenAI 发布面向 o1 模型的新对齐策略“审议式对齐”,直接教模型安全规范并让其对这些规范进行推理。该策略的核心是借助模型的推理能力来提升安全性。

来源:OpenAI News · openai.com