跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

191 条精选近 30 天 39 条共收录 939 条

更新

精选归档 · 第 10 页

3月8日周三第 181–191 条
  1. Anthropic News62

    Anthropic 阐述对 AI 安全的核心观点:何时、为何、是什么与怎么做

    Anthropic 发布文章系统阐述其对 AI 安全的核心观点,认为 AI 影响可能堪比工业与科学革命,并可能在未来十年内到来。文章称算力投入以每年 10 倍增长,规模定律表明更多算力带来能力普遍提升,因此快速进展可能持续而非停滞。

    推荐理由:Anthropic 官方系统阐述其对 AI 安全风险的判断与研究方向,可了解其安全策略背后的推理框架。

2月24日周五
2月16日周四
1月31日周二
1月24日周二
6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。

    推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。

4月29日周五
1月27日周四
  1. OpenAI News80

    OpenAI 发布 InstructGPT,成为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。

9月19日周四
  1. OpenAI News60

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。

2月20日周二
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。