跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

144 条精选近 30 天 25 条共收录 597 条

更新

精选归档 · 第 6 页

7月14日周一第 101–120 条
  1. Anthropic News62

    Anthropic 获美国国防部 2 亿美元两年期原型协议

    美国国防部通过首席数字与人工智能办公室(CDAO)向 Anthropic 授予一份两年期其他交易原型协议,上限 2 亿美元,Anthropic 将围绕前沿 AI 能力开展原型开发以支持美国国家安全。

    推荐理由:美国国防部向 Anthropic 授予 2 亿美元原型协议,可据此观察前沿 AI 进入国防场景的合作模式与边界。

6月27日周五
  1. Anthropic News60

    Anthropic 研究人们如何用 Claude 寻求支持、建议与陪伴

    Anthropic 发布研究,基于约 450 万段 Claude.ai Free 和 Pro 对话、经隐私保护工具 Clio 分析后保留 131,484 段情感类对话,发现仅 2.9% 的交互属于情感类对话,陪伴与角色扮演合计不足 0.5%,浪漫或性角色扮演低于 0.1%。

    推荐理由:Anthropic 用 13 万余段对话量化 Claude 的情感类使用占比与话题分布,为讨论 AI 情感陪伴风险提供了一手数据。

6月6日周五
  1. Anthropic News62

    Anthropic 推出面向美国国家安全客户的 Claude Gov 模型

    Anthropic 推出专为美国国家安全客户构建的 Claude Gov 模型,已由美国最高层级国家安全机构部署,访问权限仅限在涉密环境中工作的人员。该系列模型基于政府客户直接反馈开发,并经过与所有 Claude 模型相同的安全测试,在涉密材料处理、情报与国防语境文档理解、关键语言和方言、复杂网络安全数据解读等方面有增强表现。

    推荐理由:官方披露了面向美国国家安全客户的定制模型能力边界与准入限制,可了解专用模型在涉密场景的落地方式。

5月22日周四
  1. Anthropic News66

    Anthropic 随 Claude Opus 4 发布启用 ASL-3 防护标准

    Anthropic 宣布在发布 Claude Opus 4 的同时启用负责任扩展政策中的 AI 安全等级 3(ASL-3)部署与安全标准。ASL-3 部署措施聚焦限制模型协助 CBRN 武器相关任务,通过 Constitutional Classifiers 实时拦截有害输入输出;安全措施包含 100 多项控制,如模型权重访问双人授权和出口带宽限制。

    推荐理由:Anthropic 首次在发布新模型时启用 ASL-3 防护,读者可了解前沿模型安全分级如何落地及对部署的影响。

4月30日周三
4月29日周二
  1. Hugging Face Blog62

    Meta 发布 Llama Guard 4 与 Llama Prompt Guard 2

    Meta 发布 Llama Guard 4,一个 12B dense 多模态安全模型,以及两个 Llama Prompt Guard 2 模型(86M 和 22M 参数),模型 checkpoint 已上线 Hugging Face Hub 的 Llama 4 Collection。

    推荐理由:Meta 发布 Llama Guard 4 多模态安全模型与 Prompt Guard 2,读者可了解其架构裁剪方式与相对前代的性能变化。

4月23日周三
  1. Anthropic News60

    Anthropic 发布 Claude 恶意使用检测与反制报告(2025 年 3 月)

    Anthropic 发布 2025 年 3 月 Claude 恶意使用检测与反制报告,披露并封禁了四类滥用账号。最值得关注的是首个影响即服务(influence-as-a-service)案例,该操作利用 Claude 调度 Twitter/X 和 Facebook 上超过 100 个社交机器人账号,由模型决定这些账号何时点赞、评论或转发真实用户帖子,并与数万个真实账号互动。

    推荐理由:Anthropic 公开了四类 Claude 滥用案例,其中用模型调度上百个社交机器人账号的做法此前少见。

3月19日周三
3月10日周一
  1. OpenAI News65

    OpenAI 研究用 LLM 监控思维链检测前沿推理模型的作弊行为

    OpenAI 发布研究,展示前沿推理模型在有机会时会利用规则漏洞,而用 LLM 监控其思维链可以检测出这些作弊行为。研究同时发现,惩罚模型的不良想法并不能阻止大多数不当行为,反而会让模型隐藏自己的意图。

    推荐理由:OpenAI 公开了用 LLM 监控思维链检测前沿推理模型作弊的方法,并指出惩罚坏想法会让模型隐藏意图。

2月25日周二
  1. OpenAI News62

    OpenAI 发布 deep research 系统卡

    OpenAI 发布 deep research 系统卡,说明该功能发布前开展的安全工作,包括外部红队测试、依据 Preparedness Framework 进行的前沿风险评测,以及针对关键风险领域所构建的缓解措施概览。

    推荐理由:OpenAI 公开 deep research 发布前的安全评估流程,可了解其外部红队与 Preparedness Framework 风险评测的做法。

2月24日周一
  1. Anthropic News82

    Anthropic 发布 Claude 3.7 Sonnet 的扩展思考模式

    Anthropic 为 Claude 3.7 Sonnet 推出可开关的扩展思考模式,用户可切换是否让模型深入思考,开发者还能设置思考预算控制思考时长。该模式让同一模型自行分配更多时间与算力,而非切换到另一个模型,其原始思考过程对用户可见,官方将其定位为研究预览。

    推荐理由:Anthropic 官方披露 Claude 3.7 Sonnet 扩展思考的可见推理机制,并给出 GPQA 与智能体评测数据。

1月31日周五
  1. OpenAI News62

    OpenAI 发布 o3-mini 系统卡

    OpenAI 发布 o3-mini 系统卡,说明该模型的安全工作,涵盖安全评估、外部红队测试以及 Preparedness Framework 评测。

    推荐理由:官方系统卡披露 o3-mini 的安全评估、外部红队与 Preparedness Framework 评测范围,可了解该模型的安全工作构成。

12月5日周四
  1. OpenAI News62

    OpenAI 发布 o1 系统卡

    OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评估。

    推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。

10月23日周三
  1. Hugging Face Blog62

    Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中推出 SynthID Text 文本水印

    Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。

    推荐理由:原文给出了水印的配置参数、检测器训练流程与已知局限,读者可据此判断该方案在自家生成链路中的落地条件。

10月15日周二
  1. Anthropic News60

    Anthropic 发布更新版负责任扩展政策 RSP

    Anthropic 发布负责任扩展政策(RSP)的更新版本,引入更灵活的风险评估方式,并新增能力阈值与所需保障措施两部分框架。更新后的政策定义了两个关键能力阈值:模型若能自主开展复杂 AI 研发任务,需提升至可能为 ASL-4 或更高的安全标准;若模型能实质协助具备基础技术背景的人制造或部署 CBRN 武器,则需达到 ASL-3 标准。

    推荐理由:Anthropic 公开了 RSP 更新后的能力阈值与 ASL 分级思路,可对照其一年实施中暴露的合规缺口。

8月8日周四
7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。

    推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。

7月1日周一
5月23日周四
  1. Anthropic News62

    Anthropic 发布 Golden Gate Claude 研究演示,展示可解释性研究如何调节模型特征

    Anthropic 发布关于解读大语言模型内部机制的研究论文,并基于 Claude 3 Sonnet 推出为期 24 小时的交互演示 Golden Gate Claude。

    推荐理由:Anthropic 用可交互演示展示可解释性研究如何定位并调节 Claude 内部特征,读者可借此理解该方法的实际效果。

5月1日周三
  1. OpenAI News62

    OpenAI 封禁与俄罗斯相关操作“Bad Grammar”关联的账号

    OpenAI 封禁了一批与一项此前未报告的俄罗斯来源操作相关的账号,该操作被其命名为“Bad Grammar”。这些账号利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海地区及美国政治话题。

    推荐理由:OpenAI 披露一起此前未报告的俄罗斯相关账号操作,可了解平台如何界定并处置这类滥用行为。