跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

177 条精选近 30 天 38 条共收录 819 条

更新

精选归档 · 第 9 页

8月9日周三第 161–177 条
  1. Anthropic News62

    Anthropic 发布 Claude Instant 1.2

    Anthropic 通过 API 发布 Claude Instant 1.2,这是其更快、更低价但仍具能力的模型版本,融合了 Claude 2 在真实场景中的优势,在数学、编码、推理和安全方面有明显提升。

    推荐理由:官方给出 Claude Instant 1.2 在数学、编码与安全上的具体基准对比,可据此判断轻量模型的性价比变化。

7月26日周三
7月11日周二
  1. Anthropic News85

    Anthropic 发布 Claude 2,支持 100K token 上下文并开放 claude.ai 公测

    Anthropic 发布新模型 Claude 2,可通过 API 使用,并在美国与英国上线 claude.ai 公开测试网站。Claude 2 在编码、数学和推理上较前代提升,Bar 考试多选题得分从 Claude 1.3 的 73.0% 升至 76.5%,Codex HumanEval 从 56.0% 升至 71.2%,GSM8k 从 85.2% 升至 88.0%。

    推荐理由:官方给出 Claude 2 在 Bar、GRE、HumanEval 等基准上的具体分数与 100K token 上下文,便于对照前代判断能力提升幅度。

5月31日周三
  1. OpenAI News65

    OpenAI 用过程监督提升数学推理能力

    OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。

5月23日周二
  1. Hugging Face Blog60

    Hugging Face 公布 safetensors 安全审计结果并推动其成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。

    推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。

5月9日周二
  1. Anthropic News62

    Anthropic 公布 Claude 的宪法与 Constitutional AI 训练方法

    Anthropic 发布 Claude 的宪法全文,说明 Constitutional AI 用一组明文原则替代大规模人类反馈来塑造模型行为。训练分两阶段:先让模型依据原则自我批评和修改回答,再用基于原则的 AI 反馈做强化学习,官方称其在无害性上未使用人类数据,并称 Constitutional RL 在有用性与无害性上相对 RLHF 取得帕累托改进。

    推荐理由:Anthropic 公开 Claude 宪法全文与 Constitutional AI 的两阶段训练流程,可了解模型价值观如何被显式写入并可调整。

3月8日周三
  1. Anthropic News62

    Anthropic 阐述对 AI 安全的核心观点:何时、为何、是什么与怎么做

    Anthropic 发布文章系统阐述其对 AI 安全的核心观点,认为 AI 影响可能堪比工业与科学革命,并可能在未来十年内到来。文章称算力投入以每年 10 倍增长,规模定律表明更多算力带来能力普遍提升,因此快速进展可能持续而非停滞。

    推荐理由:Anthropic 官方系统阐述其对 AI 安全风险的判断与研究方向,可了解其安全策略背后的推理框架。

2月24日周五
2月16日周四
1月31日周二
1月24日周二
6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。

    推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。

4月29日周五
1月27日周四
  1. OpenAI News80

    OpenAI 发布 InstructGPT,成为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用其对齐研究中的技术并引入人类参与训练。这些模型现已作为 OpenAI API 的默认语言模型部署。

    推荐理由:OpenAI 官方说明 InstructGPT 的指令跟随与对齐改进,并交代其已成为 API 默认模型。

9月19日周四
  1. OpenAI News60

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈对 774M 参数的 GPT-2 语言模型进行微调,在多项任务上成功匹配外部人类标注者的偏好,但这些偏好并不总与 OpenAI 自己的预期一致。在摘要任务中,标注者偏好直接照抄输入的句子,模型因此学会了复制;摘要任务需要 6 万条人类标注,而按不同风格续写文本等更简单的任务只需 5 千条。OpenAI 表示其动机是让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:OpenAI 用人类反馈微调 GPT-2 的早期实验,展示了偏好数据如何影响模型行为,也暴露了标注偏好与研究者预期的偏差。

2月20日周二
6月13日周二
  1. OpenAI News62

    OpenAI 与 DeepMind 提出从人类偏好中学习目标的方法

    OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。

    推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。