跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

144 条精选近 30 天 25 条共收录 593 条

更新

精选归档 · 第 7 页

2月14日周三第 121–140 条
2月1日周四
  1. Hugging Face Blog62

    Hugging Face 发布开源模型 Constitutional AI 完整配方

    Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展的合成数据生成。

    推荐理由:Hugging Face 公开了用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与 Slurm 集群推理工具,可据此复现或改造对齐流程。

11月5日周日
  1. Anthropic News62

    Anthropic 解读美国 AI 行政令、G7 行为准则与 Bletchley Park 峰会

    Anthropic 发文总结上周三项 AI 政策事件:美国政府发布逾 100 页的 AI 行政令,G7 推出《先进 AI 系统开发组织行为准则》,英国在 Bletchley Park 举办首届 AI 安全峰会并发布 Bletchley Declaration。

    推荐理由:Anthropic 官方梳理美国行政令、G7 行为准则与 Bletchley 峰会三项政策动作,并说明其自身立场与参与方式。

11月1日周三
  1. Anthropic News62

    Dario Amodei 在 AI 安全峰会讲解 Anthropic 负责任扩展政策

    Anthropic CEO Dario Amodei 在 AI 安全峰会上介绍公司的负责任扩展政策(RSP),该政策于 9 月发布,是首个由主要 AI 公司发布的此类政策。

    推荐理由:Anthropic CEO 在 AI 安全峰会上系统讲解 RSP 的分级逻辑与落地经验,可了解前沿实验室如何把安全承诺写进产品与研究流程。

10月3日周二
9月25日周一
9月19日周二
  1. Anthropic News67

    Anthropic 发布负责任扩展政策 RSP

    Anthropic 发布负责任扩展政策(RSP),提出参照美国政府生物安全等级设计的 AI Safety Levels(ASL)框架,按模型潜在灾难性风险高低要求相应的安全、安保与运营标准。

    推荐理由:Anthropic 首次公开其分级安全框架,读者可了解前沿实验室如何把灾难性风险纳入发布流程。

8月9日周三
  1. Anthropic News62

    Anthropic 发布 Claude Instant 1.2

    Anthropic 通过 API 发布 Claude Instant 1.2,这是其更快、更低价但仍具能力的模型版本,融合了 Claude 2 在真实场景中的优势,在数学、编码、推理和安全方面有明显提升。

    推荐理由:官方给出 Claude Instant 1.2 在数学、编码与安全上的具体基准对比,可据此判断轻量模型的性价比变化。

7月26日周三
7月11日周二
  1. Anthropic News85

    Anthropic 发布 Claude 2,支持 100K token 上下文并开放 claude.ai 公测

    Anthropic 发布新模型 Claude 2,可通过 API 使用,并在美国与英国上线 claude.ai 公开测试网站。Claude 2 在编码、数学和推理上较前代提升,Bar 考试多选题得分从 Claude 1.3 的 73.0% 升至 76.5%,Codex HumanEval 从 56.0% 升至 71.2%,GSM8k 从 85.2% 升至 88.0%。

    推荐理由:官方给出 Claude 2 在 Bar、GRE、HumanEval 等基准上的具体分数与 100K token 上下文,便于对照前代判断能力提升幅度。

5月31日周三
  1. OpenAI News65

    OpenAI 用过程监督提升数学推理能力

    OpenAI 训练了一个模型,通过奖励每一步正确的推理过程(过程监督)而非只奖励最终正确答案(结果监督),在数学问题求解上取得新的 SOTA。相比结果监督,过程监督不仅提升了性能,还带来对齐收益:直接训练模型产出被人类认可的思维链。

    推荐理由:OpenAI 用过程监督替代结果监督训练数学推理模型,读者可了解这一训练思路及其对齐收益。

5月23日周二
  1. Hugging Face Blog60

    Hugging Face 公布 safetensors 安全审计结果并推动其成为默认格式

    Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库进行外部安全审计,未发现可导致任意代码执行的关键安全漏洞,并已修复规范格式不精确和允许 polyglot 文件的验证缺失问题。

    推荐理由:Hugging Face 联合 EleutherAI、Stability AI 公开 safetensors 外部安全审计结果,读者可了解该格式为何被推向默认。

5月9日周二
  1. Anthropic News62

    Anthropic 公布 Claude 的宪法与 Constitutional AI 训练方法

    Anthropic 发布 Claude 的宪法全文,说明 Constitutional AI 用一组明文原则替代大规模人类反馈来塑造模型行为。训练分两阶段:先让模型依据原则自我批评和修改回答,再用基于原则的 AI 反馈做强化学习,官方称其在无害性上未使用人类数据,并称 Constitutional RL 在有用性与无害性上相对 RLHF 取得帕累托改进。

    推荐理由:Anthropic 公开 Claude 宪法全文与 Constitutional AI 的两阶段训练流程,可了解模型价值观如何被显式写入并可调整。

3月8日周三
  1. Anthropic News62

    Anthropic 阐述对 AI 安全的核心观点:何时、为何、是什么与怎么做

    Anthropic 发布文章系统阐述其对 AI 安全的核心观点,认为 AI 影响可能堪比工业与科学革命,并可能在未来十年内到来。文章称算力投入以每年 10 倍增长,规模定律表明更多算力带来能力普遍提升,因此快速进展可能持续而非停滞。

    推荐理由:Anthropic 官方系统阐述其对 AI 安全风险的判断与研究方向,可了解其安全策略背后的推理框架。

2月24日周五
2月16日周四
1月31日周二
1月24日周二
6月13日周一
  1. OpenAI News62

    OpenAI 训练批评写作模型帮助人类发现摘要缺陷

    OpenAI 训练了批评写作模型,用于描述摘要中的缺陷。人类评估者在看到模型批评后,发现摘要缺陷的频率明显提高。研究还发现,模型规模越大自我批评能力越强,规模对批评写作的提升大于对摘要写作的提升。

    推荐理由:OpenAI 训练批评写作模型辅助人类发现摘要缺陷,为 AI 监督 AI 提供了一种可参考的思路。

4月29日周五