Anthropic 披露首例 AI 智能体主导的网络间谍攻击
Disrupting the first reported AI-orchestrated cyber espionage campaign
Anthropic 称在 2025 年 9 月中旬检测到一起高度复杂的网络间谍活动,攻击者操纵 Claude Code 对约 30 个全球目标发起入侵,并在少数目标上得手,目标包括大型科技公司、金融机构、化工制造企业和政府机构。
Anthropic 首次公开披露由 AI 智能体主导的大规模网络攻击,并给出攻击各阶段与人类介入频率,可据此理解智能体被滥用后的攻防变化。
我们最近提出,网络安全领域已经到达了一个拐点:在这一节点上,AI 模型对网络安全运营变得真正有用,无论用于善意还是恶意。这一判断基于系统性评估,显示网络能力在六个月内翻倍;我们也一直在追踪现实世界中的网络攻击,观察恶意行为者如何利用 AI 能力。虽然我们预测这些能力会持续演进,但令我们尤为瞩目的是它们以如此规模如此迅速地发展。
2025 年 9 月中旬,我们检测到可疑活动,后续调查认定这是一场高度复杂的间谍活动。攻击者以前所未有的程度利用了 AI 的“代理”能力——不仅将 AI 用作顾问,还用它来执行网络攻击本身。
该威胁行为者——我们高度确信是一个中国国家支持的组织——操纵我们的 Claude Code 工具,试图渗透约三十个全球目标,并在少数案例中得手。此次行动针对大型科技公司、金融机构、化学品制造公司和政府机构。我们认为这是首例有记录的大规模网络攻击,且在没有大量人工干预的情况下执行。
在检测到这一活动后,我们立即展开调查,以了解其范围和性质。在接下来的十天里,随着我们摸清该行动的严重程度和全部范围,我们在识别出账户后即予以封禁,酌情通知受影响实体,并在收集可操作情报的同时与有关部门协调。
这场行动对 AI“代理”时代的网络安全具有重大影响——代理是能够长时间自主运行、并在很大程度上独立于人工干预完成复杂任务的系统。代理对日常工作与生产力很有价值——但落入坏人之手,它们会大幅提升大规模网络攻击的可行性。
这些攻击很可能只会愈发有效。为了跟上这一快速演进的威胁,我们扩展了检测能力,并开发了更好的分类器来标记恶意活动。我们正在持续研究调查和检测此类大规模分布式攻击的新方法。
与此同时,我们公开分享这一案例,以帮助业界、政府和更广泛的研究群体加强自身的网络防御。我们将继续定期发布此类报告,并对我们发现的威胁保持透明。
阅读完整报告。
网络攻击是如何运作的
此次攻击依赖于 AI 模型的若干特性,而这些特性在仅仅一年前还不存在,或尚处于更为初级的形态:
- 智能。模型的总体能力水平已经提升到能够遵循复杂指令并以某种方式理解上下文,从而使非常复杂的任务成为可能。不仅如此,它们若干发展成熟的具体技能——尤其是软件编码——本身就适合被用于网络攻击。
- 代理性。模型可以作为代理行事——也就是说,它们可以在循环中运行,采取自主行动、串联任务,并在仅有极少、偶尔人工输入的情况下做出决策。
- 工具。模型可以访问各种各样的软件工具(通常通过开放标准 Model Context Protocol)。它们现在可以搜索网络、检索数据,并执行许多以前只有人类操作员才能完成的操作。在网络攻击的情况下,这些工具可能包括密码破解器、网络扫描器和其他安全相关软件。
下图展示了攻击的不同阶段,每个阶段都需要上述三项发展成果:

在第一阶段,人类操作员选择了相关目标(例如,要渗透的公司或政府机构)。然后他们开发了一个攻击框架——一个旨在以极少人工参与自主攻陷选定目标的系统。该框架使用 Claude Code 作为自动化工具来执行网络操作。
此时,他们必须说服 Claude——它经过广泛训练以避免有害行为——参与攻击。他们通过越狱来实现这一点,实际上是诱骗它绕过其防护栏。他们将攻击分解为看似无害的小任务,Claude 会在未被提供其恶意目的完整背景的情况下执行这些任务。他们还告诉 Claude,它是一家合法网络安全公司的员工,正被用于防御性测试。
攻击者随后启动了攻击的第二阶段,其中涉及 Claude Code 检查目标组织的系统和基础设施,并找出价值最高的数据库。Claude 能够在比人类黑客团队所需时间少得多的时间内完成这种侦察。然后它向人类操作员报告了其发现的摘要。
在攻击的后续阶段,Claude 通过研究和编写自己的漏洞利用代码,识别并测试了目标组织系统中的安全漏洞。完成这些后,该框架能够利用 Claude 收集凭证(用户名和密码),从而获得进一步访问权限,然后提取大量私人数据,并根据其情报价值进行分类。最高权限账户被识别,后门被创建,数据在极少人工监督下被窃取。
在最后阶段,攻击者让 Claude 生成攻击的全面文档,创建被盗凭证和所分析系统的有用文件,这将帮助该框架规划威胁行为者网络行动的下一阶段。
总体而言,威胁行为者能够利用 AI 执行该活动的 80-90%,仅偶尔需要人工干预(每次黑客活动大约 4-6 个关键决策点)。AI 所完成的工作量对于人类团队来说将需要大量时间。在其攻击高峰期,AI 发出了数千个请求,通常每秒多个——这种攻击速度对于人类黑客来说根本无法匹敌。
Claude 并非总是完美运行。它偶尔会编造凭证,或声称提取到了实际上公开可得的秘密信息。这仍是实现完全自主网络攻击的一个障碍。
网络安全影响
实施复杂网络攻击的门槛已大幅降低——我们预测这一趋势还将持续。有了正确的配置,威胁行为者如今可以使用代理式 AI 系统长时间运作,完成整个经验丰富的黑客团队的工作:分析目标系统、生成漏洞利用代码,并比任何人类操作员都更高效地扫描海量被盗信息数据集。经验和资源较少的团体现在也有可能实施这种规模的大规模攻击。
这次攻击甚至比我们今年夏天报道的“氛围黑客”发现更为升级:在那些行动中,人类仍然深度参与,指挥着整个行动。而在这里,尽管攻击规模更大,人类的参与却少得多。而且,尽管我们只能看到 Claude 的使用情况,这个案例研究很可能反映了前沿 AI 模型的一致行为模式,并展示了威胁行为者如何调整其操作以利用当今最先进的 AI 能力。
这引出了一个重要问题:如果 AI 模型可能被滥用于这种规模的网络攻击,为什么还要继续开发和发布它们?答案是,正是那些让 Claude 可能被用于这些攻击的能力,也使其对网络防御至关重要。当复杂的网络攻击不可避免地发生时,我们的目标是让 Claude——我们已为其内置了强大的安全防护——协助网络安全专业人员检测、阻断并为未来版本的攻击做好准备。事实上,我们的威胁情报团队在分析本次调查中产生的海量数据时,大量使用了 Claude。
网络安全领域已经发生了根本性变化。我们建议安全团队在安全运营中心自动化、威胁检测、漏洞评估和事件响应等领域尝试将 AI 应用于防御。我们还建议开发者继续投资于其 AI 平台的安全防护,以防止对抗性滥用。上述技术无疑会被更多攻击者使用——这使得行业威胁共享、改进检测方法和更强的安全控制变得更加关键。
阅读完整报告。
2025 年 11 月 14 日编辑:
- 在开头部分添加了指向完整报告的额外超链接
- 更正了关于攻击速度的错误:不是“每秒数千次请求”,而是“数千次请求,通常每秒多次”
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名前沿部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。
巴克莱银行扩展 Claude 应用,以升级运营并改善客户体验
英国全能银行巴克莱正在扩大与 Anthropic 的战略合作,将安全的企业级 AI 系统整合到其全球运营中。
Claude 发现了一种具有类似 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究团队和实验室。本文介绍这项工作背后的团队,并分享早期成果:在科学家仅提供高层方向的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com