跳到正文
10月4日周日
10月3日周六
  1. 新智元66

    Hinton、Bengio等22位学者联名发布智能爆炸报告

    Hinton、Bengio等22位学者在剑桥大学CASP平台发布15页报告,讨论AI自主研发引发智能爆炸的风险与应对。报告引用产业数据称,Anthropic内部AI编写代码比例从去年年初的个位数升至2026年5月的80%以上,完全由AI自主完成、人类仅做高级别监督的研发工作比例五个月内从1%升至26%;OpenAI与谷歌内部AI生成代码比例也分别达到80%和75%。

10月2日周五
  1. Google Research66

    Google 发布基于 TEE 的联邦学习系统,Gboard 已采用

    Google 发布新一代联邦学习系统,利用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强且准确率提升。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署情况,可了解隐私计算在端侧训练中的工程路径。

9月30日周三
  1. Google DeepMind62

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入水印

    Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时保持其生物功能。

    推荐理由:DeepMind 把水印从数字内容延伸到合成生物,公开了方法与代码,可观察生物安全筛查这一新方向。

  2. 开源中国78

    Anthropic 红队评估 GLM-5.3:自主漏洞利用能力追平 Claude Mythos Preview

    Anthropic 前沿红色团队评估智谱 GLM-5.3,认为它是首个能像五个月前 Claude Mythos Preview 那样自主构建端到端漏洞利用、却几乎未设拒绝护栏就放出的模型。五个月前 Anthropic 发布 Claude Mythos Preview 时,曾称其为第一个能自主构建复杂端到端漏洞利用的 AI 模型。

    推荐理由:Anthropic 红队对 GLM-5.3 的评估给出了自主漏洞利用能力与拒绝护栏缺失的对比,可了解前沿模型安全评估的一种视角。

  3. Simon Willison65

    Anthropic 红队:GLM-5.3 与 Claude Mythos Preview 在二进制漏洞利用基准上的表现

    Anthropic Frontier Red Team 在内部 Binary Exploitation benchmark 中随机抽取 100 个任务评测多个模型,GLM-5.3 在 4% 的试验中实现完整的控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前的 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。

9月29日周二
  1. Hugging Face Blog34

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"证据池中有支持"与"由答案所指来源支持",专门捕捉跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中得分最高。

9月23日周三
9月7日周一
8月12日周三
7月27日周一
  1. Import AI62

    Epoch 与 METR 发布 MirrorCode 长周期编程基准

    Epoch 与 METR 发布 MirrorCode 基准,考察 AI 仅凭 CLI 访问重新实现软件程序的能力,覆盖 25 个目标程序。Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,17/25 的目标程序至少有一次满分运行,但 8/25 从未达到 100% 阈值,ruff、giac_subset 和 mailauth 最难。

7月23日周四
  1. Google Research62

    Google Research 用强化学习让量子计算机从错误中学习

    Google Research 在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调节数千个控制参数以对抗漂移。在 Willow 超导处理器上人为注入漂移后,该方法将纠错码的逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步把逻辑错误率压低 20%,使表面码逻辑错误降至每千个纠错周期不到一次。

    推荐理由:Google 用强化学习让量子处理器在计算中持续校准控制参数,读者可了解纠错与校准解耦这一瓶颈的新解法。

7月15日周三
6月19日周五
  1. Hugging Face Blog49

    MosaicLeaks:你的深度研究智能体能守住秘密吗?

    Hugging Face 博客提出 MosaicLeaks,用 1001 条多跳研究链测试深度研究智能体的隐私泄漏,其外部查询日志可被拼凑出私有企业信息。测试中智能体频繁泄漏,仅优化任务表现会加剧泄漏;其 Privacy-Aware Deep Research(PA-DR)RL 训练方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄漏从 34.0% 降至 9.9%。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap 与智能体安全技术框架

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部部署和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,把内部智能体视为可能未对齐的潜在内部威胁。

    推荐理由:DeepMind 公开内部 AI 控制路线图,给出检测与响应分级和百万条编码智能体轨迹的实测数据,可供安全团队参考。

6月11日周四
  1. Google Research29

    Google Research 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘

    Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。该框架基于 f-divergence,支持 Chi-squared、KL 和 Hockey-stick 等散度,可自动选择最优散度与超参数,无需样本划分,并在任意样本量下控制假阳性。

6月8日周一
5月28日周四
  1. Google Research36

    Google 推出零信任聚合的隐私分析方案

    Google 为隐私分析服务推出零信任聚合方案,结合新型密码学聚合协议与 TEE,使设备只需单条消息即可安全提交数据,无需多轮在线交互。该协议可证明 Google 只能获得群体的匿名聚合洞察,原始个体数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则向参与者验证协议按公开代码正确执行。

4月3日周五
3月31日周二
3月26日周四
  1. Google DeepMind60

    Google DeepMind 发布首个经实证验证的 AI 有害操纵评测工具

    Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度共 9 项实验、逾 10000 名参与者,聚焦金融与健康等高风险场景,发现 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功不能预测另一个领域。

    推荐理由:原文公开了可复用的有害操纵评测工具与万人级实验数据,读者可据此了解AI操纵能力的测量方式与边界。

3月19日周四
3月12日周四
  1. Google Research62

    Google 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。

    推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。

3月10日周二
3月5日周四
2月18日周三
2月4日周三
  1. Google Research62

    Google 与 Included Health 合作开展全国性随机研究评估虚拟护理中的对话 AI

    Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟护理工作流中评估对话 AI 的表现。

    推荐理由:Google 与 Included Health 合作开展全国性随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。

12月18日周四
12月16日周二
12月11日周四
  1. Google Research32

    Google 提出 Urania:用差分隐私框架分析 AI 聊天机器人使用情况

    Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。

12月3日周三
11月19日周三
  1. OpenAI News62

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。

    推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。

11月13日周四
10月30日周四
10月29日周三
10月27日周一