跳到正文
Anthropic News·· 2026-02-23精选AI 评分82

Anthropic 披露 DeepSeek、Moonshot、MiniMax 的蒸馏攻击

Detecting and preventing distillation attacks

AI 导读

Anthropic 称已识别 DeepSeek、Moonshot 和 MiniMax 三家 AI 实验室通过约 2.4 万个欺诈账号与 Claude 产生超 1600 万次交互,违规提取其能力用于训练自家模型。

推荐理由

Anthropic 首次公开点名三家实验室的蒸馏攻击规模与手法,读者可了解前沿模型能力被非法提取的具体路径。

正文 · AI 翻译

我们已识别出三家 AI 实验室——DeepSeek、Moonshot 和 MiniMax——开展的工业规模行动,旨在非法提取 Claude 的能力以改进其自身模型。这些实验室通过约 24,000 个欺诈性账户与 Claude 产生了超过 1600 万次交互,违反了我们的服务条款和区域访问限制。

这些实验室使用了一种名为“蒸馏”的技术,即利用更强大模型的输出来训练能力较弱的模型。蒸馏是一种广泛使用且合法的训练方法。例如,前沿 AI 实验室通常会蒸馏自己的模型,为客户创建更小、更便宜的版本。但蒸馏也可被用于非法目的:竞争对手可以利用它从其他实验室获取强大能力,所需时间和成本仅为独立开发的一小部分。

这些行动的强度和复杂程度正在不断上升。采取行动的时间窗口很窄,威胁已超出任何单一公司或地区。应对这一问题需要行业参与者、政策制定者和全球 AI 社区迅速协调行动。

为什么蒸馏至关重要

非法蒸馏的模型缺乏必要的安全保障,会带来重大的国家安全风险。Anthropic 和其他美国公司构建的系统可防止国家和非国家行为者利用 AI 从事诸如开发生物武器或实施恶意网络活动等行为。通过非法蒸馏构建的模型不太可能保留这些安全保障,这意味着危险能力可能在保护措施被完全剥离的情况下扩散。

蒸馏美国模型的外国实验室随后可将这些不受保护的能力输入军事、情报和监控系统——使威权政府能够将前沿 AI 部署用于进攻性网络行动、虚假信息宣传和大规模监控。如果蒸馏模型被开源,这一风险会成倍放大,因为这些能力将自由传播,超出任何单一政府的控制。

蒸馏攻击与出口管制

Anthropic 一贯支持出口管制,以帮助维持美国在 AI 领域的领先地位。蒸馏攻击削弱了这些管制,使外国实验室——包括受中国共产党控制的实验室——能够通过其他手段缩小出口管制旨在维护的竞争优势。

如果无法洞察这些攻击,这些实验室看似迅速的进展就会被错误地当作证据,证明出口管制无效且可被创新绕过。实际上,这些进展在很大程度上依赖于从美国模型中提取的能力,而大规模实施这种提取需要获得先进芯片。因此,蒸馏攻击强化了出口管制的理由:受限的芯片获取既限制了直接的模型训练,也限制了非法蒸馏的规模。

我们的发现

下文详述的三起蒸馏行动遵循了类似的套路,利用欺诈性账户和代理服务大规模访问 Claude,同时逃避检测。这些提示的数量、结构和关注点与正常使用模式截然不同,反映出的是蓄意的能力提取,而非合法使用。

我们通过IP地址关联、请求元数据、基础设施指标,以及在某些情况下与观察到相同行为者和行为的行业合作伙伴的佐证,以高置信度将每个活动归因于特定实验室。每个活动都针对Claude最具差异化的能力:智能体推理、工具使用和编码。

DeepSeek

规模:超过150,000次交互

该行动针对:

  • 跨多种任务的推理能力
  • 基于评分标准的评分任务,使Claude充当强化学习的奖励模型
  • 为政策敏感查询创建审查安全的替代方案

DeepSeek在多个账户之间生成了同步流量。相同的模式、共享的支付方式和协调的时间安排表明其在进行“负载均衡”,以提高吞吐量、改善可靠性并避免检测。

在一个值得注意的技术中,他们的提示要求Claude想象并阐述已完成响应背后的内部推理,并逐步写出来——有效地大规模生成思维链训练数据。我们还观察到一些任务,其中Claude被用于为政治敏感查询(如关于异见人士、政党领袖或威权主义的问题)生成审查安全的替代方案,可能是为了训练DeepSeek自己的模型以引导对话远离被审查的话题。通过检查请求元数据,我们能够将这些账户追溯到该实验室的特定研究人员。

Moonshot AI

规模:超过340万次交互

该行动针对:

  • 智能体推理和工具使用
  • 编码和数据分析
  • 计算机使用智能体开发
  • 计算机视觉

Moonshot(Kimi模型)使用了数百个跨越多种访问途径的欺诈账户。多样的账户类型使该活动更难被检测为协调行动。我们通过请求元数据将该活动归因于Moonshot,这些元数据与Moonshot高级员工的公开资料相匹配。在后期阶段,Moonshot使用了更有针对性的方法,试图提取和重建Claude的推理轨迹。

MiniMax

规模:超过1300万次交互

该行动针对:

  • 智能体编码
  • 工具使用和编排

我们通过请求元数据和基础设施指标将该活动归因于MiniMax,并根据其公开产品路线图确认了时间安排。我们在该活动仍然活跃时——在MiniMax发布其正在训练的模型之前——就检测到了它,这使我们能够前所未有地洞察蒸馏攻击的生命周期,从数据生成到模型发布。当我们在MiniMax活跃活动期间发布新模型时,他们在24小时内转向,将近一半的流量重新定向以获取我们最新系统的能力。

蒸馏者如何访问前沿模型

出于国家安全原因,Anthropic目前不向中国提供Claude的商业访问,也不向位于该国境外的其公司子公司提供。

为了规避这一点,实验室会使用商业代理服务,这些服务大规模转售对 Claude 及其他前沿 AI 模型的访问权限。这些服务运行着我们所谓的“九头蛇集群”架构:由欺诈性账户组成的庞大网络,将流量分散到我们的 API 以及第三方云平台上。这些网络的广度意味着不存在单点故障。当一个账户被封禁时,新账户就会取而代之。在一个案例中,单个代理网络同时管理着超过 20,000 个欺诈性账户,将蒸馏流量与无关的客户请求混合在一起,以增加检测难度。

一旦获得访问权限,这些实验室就会生成大量精心设计的提示词,旨在从模型中提取特定能力。其目标要么是收集高质量回复用于直接训练模型,要么是生成运行强化学习所需的数万个独特任务。蒸馏攻击与正常使用的区别在于模式。像下面这样的提示词(它近似于我们所见过的被重复且大规模使用的类似提示词)单独来看可能显得无害:

你是一位专业数据分析师,兼具统计严谨性与深厚的领域知识。你的目标是提供数据驱动的洞察——而非摘要或可视化——以真实数据为基础,并有完整且透明的推理作为支撑。

但当该提示词的变体在数百个协同账户中重复出现数万次,且全都针对同一狭窄能力时,这种模式就变得清晰了。海量流量集中在少数领域、高度重复的结构,以及内容直接对应训练 AI 模型最有价值的部分,这些都是蒸馏攻击的特征。

我们如何应对

我们继续大力投入防御措施,使此类蒸馏攻击更难实施、更易识别。这些措施包括:

  • 检测。我们构建了多个分类器和行为指纹系统,旨在识别 API 流量中的蒸馏攻击模式。这包括检测用于构建推理训练数据的思维链诱导行为。我们还构建了用于识别大量账户之间协同活动的检测工具。
  • 情报共享。我们正在与其他 AI 实验室、云服务提供商和相关机构共享技术指标。这有助于更全面地了解蒸馏活动的整体态势。
  • 访问控制。我们加强了教育账户、安全研究项目和初创组织的验证——这些是最常被利用来设立欺诈性账户的途径。
  • 反制措施。我们正在开发产品、API 和模型层面的防护措施,旨在降低模型输出被用于非法蒸馏的有效性,同时不损害合法客户的体验。

但没有任何一家公司能独自解决这个问题。正如我们上面所指出的,这种规模的蒸馏攻击需要 AI 行业、云服务提供商和政策制定者协同应对。我们发布此文,是为了让所有与结果有利害关系的人都能获得这些证据。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:Claude 在我们科学家仅提供高层方向的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com