Anthropic 发布 Claude 恶意使用检测与反制报告(2025 年 3 月)
Detecting and countering malicious uses of Claude: March 2025
Anthropic 发布 2025 年 3 月 Claude 恶意使用检测与反制报告,披露并封禁了四类滥用账号。最值得关注的是首个影响即服务(influence-as-a-service)案例,该操作利用 Claude 调度 Twitter/X 和 Facebook 上超过 100 个社交机器人账号,由模型决定这些账号何时点赞、评论或转发真实用户帖子,并与数万个真实账号互动。
Anthropic 公开了四类 Claude 滥用案例,其中用模型调度上百个社交机器人账号的做法此前少见。
我们致力于防止对抗性行为者滥用我们的 Claude 模型,同时保持其对合法用户的实用性。虽然我们的安全措施成功阻止了许多有害输出,但威胁行为者仍在不断探索绕过这些保护的方法。我们持续利用经验教训来升级我们的防护措施。
本报告概述了若干关于行为者如何滥用我们模型的案例研究,以及我们为检测和应对此类滥用所采取的措施。通过分享这些见解,我们希望保护用户的安全,防止对我们的服务进行滥用或误用,执行我们的使用政策及其他条款,并分享我们的经验教训以惠及更广泛的在线生态系统。本报告中呈现的案例研究虽然具体,但代表了我们在监控系统中观察到的更广泛模式。选择这些示例是因为它们清晰地展示了恶意行为者如何适应和利用前沿 AI 模型的新兴趋势。我们希望有助于更广泛地理解不断演变的威胁态势,并帮助更广泛的 AI 生态系统开发更强大的防护措施。
检测到的最新颖的滥用案例是一项专业的“影响力即服务”操作,展示了某些行为者利用 LLM 进行影响力行动活动方式的明显演变。尤其新颖的是,该操作不仅使用 Claude 生成内容,还用它来决定社交媒体机器人账号何时对真实社交媒体用户的帖子进行评论、点赞或转发。如完整报告中所述,Claude 被用作编排者,根据具有政治动机的人设决定社交媒体机器人账号应采取何种行动。阅读完整报告此处。
我们还观察到了撞库操作、招聘欺诈活动,以及一名新手行为者利用 AI 将其技术能力提升至超出自身水平的恶意软件生成能力等本博客未提及的其他活动。这些活动的影响各不相同:
- 一项“影响力即服务”操作利用 Claude 实现操作自动化,并在多个国家和语言中与数万个真实社交媒体账号进行了互动。
- 一名行为者利用 Claude 增强了用于识别和处理与安全摄像头相关的泄露用户名和密码的系统,同时收集面向互联网的目标信息以测试这些凭据。我们尚未确认这些尝试成功部署。
- 一项招聘欺诈活动利用 Claude 增强针对东欧国家求职者的诈骗内容。我们尚未确认这些尝试成功部署。
- 一名技术能力有限的个人行为者开发了通常需要更高级专业知识才能编写的恶意软件。我们尚未确认这些尝试成功部署。
我们的主要经验教训包括:
- 用户开始使用前沿模型来半自主地编排涉及众多社交媒体机器人的复杂滥用系统。随着代理式 AI 系统的改进,我们预计这一趋势将持续。
- 生成式 AI 可以加速能力较弱行为者的能力发展,可能使他们能够以先前只有技术更娴熟的个人才能达到的水平进行操作。
我们的情报项目旨在充当安全网,既发现我们标准规模化检测未能捕获的危害,又为恶意行为者如何恶意使用我们的模型增添背景信息。在调查这些案例时,我们的团队应用了我们最近发表的研究论文中描述的技术,包括 Clio 和分层摘要。这些方法使我们能够高效分析大量对话数据,以识别滥用模式。这些技术,加上分类器(分析用户输入中可能有害的请求,并在交付前后评估 Claude 的响应),使我们能够检测、调查并封禁与这些案例相关的账户。
以下案例研究突出了我们检测到的威胁类型,并提供了关于威胁行为者如何调整其操作以利用生成式 AI 的见解。
案例研究:跨平台运营多客户影响力网络 [完整报告见此处]
我们识别并封禁了一个使用 Claude 进行财务动机的“影响力即服务”操作的行为者。该行为者的基础设施利用 Claude 协调超过一百个社交媒体机器人账户,以推动其客户的政治叙事。这些政治叙事与我们对国家附属活动的预期一致,但我们尚未确认这一归属。最重要的是,该操作利用 Claude 做出战术参与决策,例如根据与客户利益一致的政治目标,确定社交媒体机器人账户是否应点赞、分享、评论或忽略其他账户创建的特定帖子。
行为者概况:该操作在 Twitter/X 和 Facebook 上管理了超过 100 个社交媒体机器人账户。操作者为每个账户创建了具有不同政治倾向的角色,并与数万个真实社交媒体账户互动。该操作的活动表明这是一项商业服务,为多个国家的客户提供服务,具有不同的政治目标。
战术和技术:该操作将 Claude 用于多种目的:
- 在平台上创建和维护具有特定政治倾向的一致角色
- 确定角色何时应点赞、分享、评论或忽略特定内容
- 以适当语言生成政治倾向的回应
- 为图像生成工具创建提示并评估其输出
行为者为不同客户维护不同的叙事组合,所有客户均在美国境外,具有他们旨在推动的不同政治叙事
影响:该操作与数万个真实社交媒体账户互动。没有内容达到病毒式传播状态,但行为者战略性地专注于持续的长期参与,推广温和的政治观点,而非追求病毒式传播。
案例研究:抓取与物联网安全摄像头相关的泄露凭证。
我们发现并封禁了一个使用我们模型的高级行为者,该行为者试图开发能力,抓取与安全摄像头相关的泄露密码和用户名,并构建能力以强行获取这些安全摄像头的访问权限。在发现这一使用行为后,我们封禁了与构建这些能力相关的账户。尽管这是该行为者的目标,但我们不知道他们最终是否成功部署了这一能力。
行为者画像:该行为者展示了高级的开发技能,并维护了一套整合多个情报来源的基础设施,包括商业泄露数据平台,以及与私有窃取日志社区的整合。
战术与技术:该行为者主要使用 Claude 来增强其技术能力:
- 重写其开源抓取工具包以便于维护
- 创建脚本以从网站抓取目标 URL
- 开发系统以处理来自窃取日志 Telegram 社区的帖子
- 改进 UI 和后端系统以增强搜索功能
其中一些技术具有双重用途。事实上,一个良性行为者可能将其用于合法目的,但重要的是要审视活动的完整背景,而在本案中,其目的是实现对设备的未授权访问。
影响:该组织活动的潜在后果包括凭证泄露、对 IoT 设备(尤其是安全摄像头)的未授权访问以及网络渗透。我们尚未确认该能力在现实世界中成功部署。
案例研究:招聘欺诈活动:用于诈骗的实时语言净化
我们发现并封禁了一个针对主要位于东欧国家的求职者进行招聘欺诈的行为者。该活动展示了威胁行为者如何使用 AI 进行实时语言净化,使其诈骗更具说服力。
行为者画像:该行动展示了中等复杂度的社会工程学技术,冒充合法公司的招聘经理以建立可信度。
战术与技术:该行为者主要使用 Claude 来增强其欺诈性通信:
- 请求语言润色以提升其通信的专业性
- 开发更具说服力的招聘叙事
- 创建面试问题和场景
- 格式化消息以显得更合法
在一个显著模式中,操作者会提交以非母语英语写成的拙劣文本,并要求 Claude 将文本调整为仿佛由英语母语者撰写——有效地洗白其通信,使其显得更精炼。这种实时语言净化提升了其通信的可信度。
影响:虽然该行动试图窃取求职者的个人信息,但我们尚未确认该行动有成功的诈骗实例。
案例研究:新手威胁行为者被赋能创建恶意软件
我们发现并封禁了一个新手行为者,该行为者利用 Claude 提升其技术能力,并开发超出其实际技能水平的恶意工具。
行为者画像:该行为者展示了有限的正式编码技能,但使用 AI 迅速扩展其能力,开发用于人肉搜索和远程访问的工具。
技术演进:我们观察到该行为者借助 Claude,从简单脚本演变为复杂系统。
- 他们的开源工具包从基础功能(可能是现成获取的)演变为包含面部识别和暗网扫描的高级套件。
- 他们的恶意软件构建器从简单的批处理脚本生成器演变为用于生成无法检测的恶意负载的全面图形用户界面,尤其侧重于规避安全控制并维持对受感染系统的持久访问。
影响:此案例说明 AI 如何可能降低恶意行为者的学习门槛,使技术知识有限的个人也能开发复杂工具,并可能加速他们从低级活动向更严重网络犯罪行为的升级。我们尚未确认该恶意软件在真实环境中的部署。
后续步骤
在我们继续开发和部署强大 AI 系统的过程中,我们始终致力于防止其被滥用,同时保留其在有益应用方面的巨大潜力。这需要我们在安全方法上持续创新,并与更广泛的安全与保障社区密切合作。
在上述所有案例中,我们都封禁了与违规活动相关的账户。此外,我们一直在改进检测方法,以检测对我们模型的对抗性使用;所描述的每一起滥用案例都已纳入我们更广泛的控制体系,以预防并更快速地检测和防止对我们模型的对抗性使用。
我们希望本报告提供的见解能帮助我们的行业、政府和更广泛的研究社区加强 AI 行业针对在线滥用的集体防御。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们科学家仅提供高层指导的情况下,Claude 发现了一种具有类似 CRISPR 特性的新型酶系统。
来源:Anthropic News · anthropic.com