Anthropic 报告指控中国实验室非法蒸馏 Claude
The Bad Guy With An AI Named Claude
Anthropic 发布报告,称在 2025 年 12 月至 2026 年 8 月间处置了七个危害领域的滥用活动,其中非法蒸馏是最重要的一项。报告称阿里(千问)、Moonshot、DeepSeek、智谱、小米等通过虚假账号网络或转发用户请求的方式提取 Claude 能力,阿里相关蒸馏在 2026 年 5 月至 7 月间超过 1.51 亿次交互。
Anthropic 报告披露中国多家实验室通过虚假账号蒸馏 Claude,并梳理了中美在 AI 安全议题上的连锁反应。
很多坏人试图利用 Claude 做坏事。大多数都失败了。我们认为。
Anthropic 已经阻止了其中一批,并发布了一份详尽的报告。如果 Anthropic 分享的是最糟糕的案例,或者接近最糟糕的案例,那么对于闭源模型来说,滥用方面的情况实际上看起来不错,甚至比我预想的还要好。
这份报告涵盖了我们在 2025 年 12 月至 2026 年 8 月期间阻止的活动,
涉及七个危害领域:网络操作、影响力行动、监控、诈骗
与欺诈、生物滥用、常规武器开发以及蒸馏。
这里面有点纵火、谋杀和乱穿马路的味道。很多人会说,其中一件事和其他几件不一样。
我不同意,尤其是考虑到我们稍后会看到的细节,并且考虑到蒸馏通过转移 Claude 的认知技能而不转移其安全防护措施,正如报告所说,能够‘驱动几乎所有任务的性能’,从而助长了其他六项威胁。
事实上,蒸馏是这份报告中迄今为止最重要的威胁,也是报告中最具影响力的部分。
通过揭露中国试图系统性地欺诈性蒸馏 Claude,Anthropic 让中国难堪,并可能激怒了中国。这始于‘所有顶尖中国实验室都曾试图蒸馏 Claude,我们已缓解并阻止了这些行为’,这已经是一个问题,而且在完整报告发布前两天,NSA/CISA/FBI 的联合咨询也提到了这一点。
更大的问题在于中国实验室是如何试图蒸馏 Claude 的。蒸馏尝试需要大量真实查询,因此 DeepSeek、Moonshot 和小米都向 Claude 直接发送了大量用户查询。至少 Moonshot 随后将结果返回给其用户,就好像这些是 Kimi 的输出一样。
这会成为一个问题。
插播无关新闻
这与今天的文章无关,但你现在需要了解基本事实,所以:
昨天我提醒过,媒体和其他人过度解读了特朗普的言论。唉,正如‘每天都有突发新闻’一样,我们现在看到特朗普说出了他之前尚未说的话。新声明非常不同,解决了昨天上午的模糊之处。
他明确宣称 AI 存在性风险是一个‘骗局’,与(他的原话)‘俄罗斯骗局’或气候变化相当。这是非常、非常坏的消息。我担心他可能已经跨过了一道修辞上的卢比孔河,一旦他更好地理解情况,一旦未来事件改变局面,将很难回头。
在我们所有人消化其影响的同时,我敦促大家:请不要让这件事比现在更加党派化或个人化。请不要攻击共和党人或特朗普。那只会让事情更糟。强调各方有益的声音。
无论可能出现什么额外声明,这都适用,我将在本周晚些时候全面报道这一不幸情况。
目录
如何不讲述一个寓言
这些分类器有时真的很烦人,但Anthropic表示它们确实有效。
在所有案例中,使用的都是Claude Haiku、Sonnet和Opus模型;在Claude Fable或Mythos上没有发现恶意活动(后者设有一系列安全防护措施,大大降低了其执行有害网络任务的能力)。
唯一的例外是智谱对Fable的一次尝试性蒸馏攻击,但由于有增强的防护措施,智谱转而针对Opus。
坏家伙往往相对不那么老练
如果坏家伙更经常是老练的且擅长本职工作,世界会大不相同。
幸运的是,坏家伙通常不老练且不擅长本职工作。
(其他所有人基本类似,但程度更低、可靠性也更差。)
AI,无论好坏,都把不擅长本职工作变成了擅长本职工作,使得人类是否不擅长本职工作变得不那么重要,因为事情由AI来做。以下是Anthropic的主要主题:
复杂的攻击不再需要复杂的攻击者。
AI在网络行动中的角色已变得越来越自主。
AI供应链既是目标、战利品,也是攻击算力。
也就是说,攻击者盯上算力来源,并利用它继续推进。
要把Claude当作坏家伙来用,你需要战利品和算力的价值,还需要新入侵账户的掩护,以赶在Anthropic打击之前行动。
基本上报告中的每个人都在窃取访问权限,至少是通过绕过区域限制和购买无穷无尽的补贴订阅,然后还用这些算力干坏家伙的事。
AI作案手法正在扩散。
和其他一切事物一样,扩散需要时间。
你需要更少的不那么老练、不那么擅长本职工作的人来干这事。
对大多数事情来说,这很棒。这份报告讲的是例外情况。
当有人防御你时,你尤其需要更少的人来适应,并开发新方法。
特定的坏家伙
GTG-20006是与Midnight Blizzard有关联的俄罗斯间谍行动。他们有一套标准的网络攻击工具。他们用AI监控其工具逃避检测的效果,并反复迭代,直到安全防御无法检测到他们的恶意软件,然后发动AI自动化攻击,包括来自AI注册域名的AI钓鱼行动。
目标多种多样,包括乌克兰政府、军事和外交人员、与乌克兰有关的多个政府机构和国防工业公司,以及乌克兰的无人机供应链。他们通过无头浏览器接管WhatsApp账户,并针对监控摄像头。这一切都是自动化的。
GTG-50014是与ShinyHunters团伙有关联的打砸抢机会主义者。他们在做标准的机会主义勾当,但AI让他们得以扩大规模、广撒网寻找易受攻击的系统,目标是批量数据窃取和潜在勒索。整件事基本上就是“氛围黑客”,靠“就地取材”,让AI四处查看并利用它找到的任何东西,寻找任何漏洞,而不是有一个计划。
GTG-10007是一次讲中文的间谍行动,很可能位于中国湖南省长沙市。Claude被用来自动化工作流程并组建智能体集群,和其他任何编码任务一样,只不过这里是漏洞研究、测试和漏洞利用设计。约有五十个组织成为目标,一家教育科技公司被入侵。
GTG-50020 是一个讲俄语、受经济利益驱动的行为体,历史上以酒店预订和金融科技平台为目标,后来转向攻击 AI 行业,并通过提示注入沙箱窃取 API 密钥。他们攻击了 30 家公司,但从未实现其目标,即获取一个预发布版 Claude 模型。
GTG-50029 是一个讲法语的黑客活动分子,以欧洲政治及相关实体为目标,这是低水平威胁行为体能力提升的一个例子,其随后成功入侵了 42 个 WordPress 网站中的 14 个,包括利用一个未记录的竞态条件,并窃取用户的政治观点,这是一次对隐私的大规模攻击。
影响力行动
影响力行动的规模正变得更大、手法也更复杂。
我们已看到一些行为体团体利用 Claude 构建虚假社交媒体资料网络和完整的新闻网站,借助这些平台发布欺骗性内容,同时完全隐藏这些行动背后的实体。
令人瞩目的是,在 AI 时代,社交媒体迄今表现得相当稳固。威胁行为体经常性地创建数百个账号,彼此提供社会认同,我们虽有抱怨,但防御方大体上正在获胜。
本报告详述了其中九个案例。它们源自俄罗斯、伊朗、土耳其以及
海湾地区、南亚、非洲和欧洲,并针对六大洲的受众。
构建此类行动会形成一种特征,Anthropic 常常能够检测到。当 Anthropic 在规划阶段发现一项行动,或事后发现时,他们会封禁相关账号,并以此强化其检测机制。但当然,此类行为体总能获取新账号并再次尝试。
列出的趋势:
影响力作为服务出售。
AI 作为新闻编辑部。
AI 既帮助构建了整套装置,也帮助生成了内容。
复杂的工具使用。
对归因、来源和确定性的洗白。
行动安全性的提升。
虚假人设(以及冒充真实人物)。
针对个人和问责机制。
影响力行动往往无法触及真正的受众。
最后的结论是我从外部观察到的。这些行动往往效果甚微,无论是个体还是整体而言,迄今为止更像是吓唬人的鬼怪,而非真正具有影响力。希望这种情况能持续下去。
这些行动大多(但并非全部)针对第三世界地区,那里的媒体和影响力生态系统中竞争较少,手法也不那么复杂。
他们列出了九个:
GTG-04001:俄罗斯在中非共和国的操纵行动,通过一条带有严重偏见的 AI 生成新闻流水线。
GTG-54002:跨越六大洲的商业“影响力即服务”,可追溯至法国。他们使用了 70 个伪造新闻网站和 250 个不真实的 Twitter 账号。利用 Claude 撰写和改写新闻文章并对其进行定制。
GTG-84005:一个针对马来西亚的选举操纵平台。约 1,000 个虚假 Twitter 账号、一个假新闻媒体和一系列伪造档案,作为付费政治影响力即服务。
GTG-24015:俄罗斯国家媒体的编辑流水线,为多个国家的受众进行编辑和新闻生产。他们针对摩尔多瓦的选举。
GTG-34001:与伊朗国家结盟的 ICCO、伊斯兰宣传办公室和 Bina Observatory。他们正在为一场解释性圣战奠定基础。
GTG-54006:针对孟加拉国农村地区的自动化、亲人民联盟、自称的假新闻行动。
GTG-84006:一场与 MEK/NCRI 立场一致的影响力行动,利用 AI 冒充一名活动人士,并在伊朗境内招募人员。他们抓取了 Telegram 上的帖子,试图拼凑出该特定活动人士的画像。
GTG-54004:肯尼亚境内的一场不真实行为行动,基本上是在操纵公众情绪。
GTG-84002:一场由阿联酋指挥的影响力行动,目标是穆斯林兄弟会、苏丹冲突以及联合国问责机制。这原本应该是“一场跨大西洋和地区的协调行动,旨在全球范围内瓦解穆斯林兄弟会”。
总体而言,我并不觉得印象深刻。看起来这些人并没有做出多少成果,至少不是通过 Claude。这其中很多东西与普通政治之间只有一线之隔。如果最坏也就这样,那这可是个非常好的消息。
监控行动
这些案例包括来自中国、伊朗和西非的威胁行为者,以及商业性的“雇佣监控”市场,范围从单个人开展的行动到整个团队。
而且他们这样做还违反了服务条款。真是胆大包天。
在许多案例中,这都是“分析大量社交媒体帖子”,包括由国家出手针对异见人士和异见团体,或可能制造麻烦的团体。大多数团体是中国的或伊朗的。在一个案例中,伊朗人针对的是犹太人。有时还涉及恶意软件。
伊朗和中国是唯一试图进行这种级别 AI 监控的地方吗?还是说,他们是唯一疯狂到使用 Claude 的?
Anthropic 重点提到了 GTG-50027:巴马科的一名独立顾问,将 Claude 作为马里国家情报机构(ANSE)的一部分,用于锁定约 2500 万张 SIM 卡。这个案例实际上并未被真正阻止。进一步的工作被阻止了,但该系统已经部署,而且仍在部署中。
这从根本上说不是一个可以解决的问题。Anthropic 和其他 AI 公司做的就是出售智能的生意,而且还有提供智能的开源模型。考虑到替代选项,没有办法完全阻止各种形式的大规模监控,无论是国内还是其他地区。Claude 在这方面相比开源模型并没有那么大的优势。如果有些人就是要分析公开信息,你可以拖慢他们,但他们终究会成功。
另一个行动因其目标而引人注目:GTG-30005:
在另一项调查中,我们发现并阻止了一个与伊朗有关联的威胁行为者,该行为者使用 Claude 收集和分析可公开访问的数据,以制定针对该地区美国海军力量的打击
建议。
这与下一节内容密切相关:Claude 在常规武器中的使用。
常规武器
这指的是用于此类武器的软件,以及瞄准和控制系统。这里有六个案例:三个在中国,两个在俄罗斯,一个在也门。
首先是武器系统开发案例:
GTG-87001:一个位于也门的制导武器工程小组,使用 Claude 开发制导软件。Claude 充当软件工程师,只不过是为武器服务。
GTG-17001:一个位于中国的行动,在其国防承包商生态系统中,为水下作战起草火控规格和采购文件。他们假扮成美国人,让 Claude 撰写提案。
GTG-27005:一个位于俄罗斯、很可能是自由职业性质的行动,旨在设计一种自主军用第一人称视角自杀式无人机蜂群。又是用错了地方的软件。
GTG-17002:一个位于中国的行动,为电子战和防空压制构建目标定位软件。
普通软件开发与协助常规武器的软件之间只有一线之隔。开发者会尝试使用 Claude 并不令人意外。事实上,想必许多西方武器开发者也在使用 Claude。
GTG-27006:一个位于俄罗斯的行动,采购军民两用物资。Claude 被用来购买物品。最终累积起来明显具有军事用途。
GTG-17003:一个位于中国的行动,收集关于定向能武器及其供应链的开源情报。
同样,这恰好是我们不喜欢的一种特定用途,而这“并无太大不同”。
生物滥用
实践中究竟有多少尝试?他们有五个案例。
区域使用控制被规避了,但这里的五个案例研究看起来像是科学家。他们在做两用性质的事情,其中并不清楚是否有意造成伤害。
一份功能获得性研究的资助申请。
一个改造出高度致病、适应哺乳动物的禽流感病毒的研究项目。
正痘病毒研究,包括相关后勤方面的帮助。
两例两用性质、不可传播的新型毒液和毒素。
前两个案例看起来明显属于“不想要”的情况,即便涉事人员认为自己在帮忙。另外三个则不那么明确。没有一个案例是我们所担心的那种危险的人工智能使用——即人工智能提供重大能力提升。人工智能被使用,是因为人工智能在普通任务上非常有用。
《纽约时报》对此的报道,标题为“Anthropic 称其阻止了可能用于制造生物武器的行为”,在这里似乎严重夸大了。
我认为这是一个巨大的成功故事,前提是 Anthropic 没有隐瞒更糟糕的事情。这些人甚至算不上十足的坏人,只是被误导了。
诈骗与欺诈
啊,终于回到普通体面的犯罪了。只不过,你知道,是规模化的。
他们只提供了一个例子,但挺有意思。
GTG-15001:虚假约会应用网络。喜欢。这才对嘛。对人工智能来说。一个由 20 个虚假约会应用组成的完整网络,拥有超过 4,700 个不同的 AI 人设,在 4 月的两周内与超过 25,000 个独立个体交谈,滑动信息流中 25% 是真人,75% 是 AI。对于那 25% 中的一些人,还雇用了工作人员在三个候选 AI 回复中选择,这证明了良好的游戏设计,并按消息付费。Claude 运行了这些 AI 人设,因为非最好的不可。我可能把细节搞乱了一点。
消息是计费的,这就是他们赚钱的方式。那是个提示。
我的意思是,是啊是啊,诈骗和欺诈,可怜的虚假用户,非常令人难过。
但这显然是最好的案例研究。
奇怪的是,这是最好的案例研究,而且这里还是唯一的一个。其他的都在哪里?这又是一个巨大的成功故事。
非法欺诈性蒸馏
这是有争议的一个。
我们将非法蒸馏定义为一种工业规模的、隐蔽的行动,旨在提取模型的能力并在未经授权的情况下将其复制到另一个模型中。非法蒸馏通常通过欺诈实现:由窃取的信用卡、登录凭证和 API 密钥创建的复杂虚假账户网络。
其他前沿实验室也面临过蒸馏攻击。OpenAI 自 2025 年初以来一直在提请注意这一活动。
如果你想主张使用自己的查询和模型输出,或以其他正当方式获取的数据进行蒸馏是没问题的,出于实际原因以及与我支持版权和专利保护相同的理由,我恭敬地不同意你的看法,但我理解你为什么会那样想。
如果你认为在此基础上使用‘思维链提取器’作为漏洞利用手段是可以接受的,那我更加不同意你,我认为你显然是错的,但我理解为什么有些人认为知识产权不是真实存在的,你可以直接窃取,并愿意为中国公司窃取美国知识产权而喝彩。
如果你认为通过秘密将敏感客户查询重新路由到 Claude,或使用用被盗信用卡、登录凭证和 API 密钥创建的账户来收集数据是可以接受的?
那么抱歉,你就是完全错了,那显然是不可以的。
我提到这些具体的事情,是因为这就是正在发生的事。
在过去几个月里,未经授权的实验室开发出越来越
复杂的方法来绕过我们的防御,并获取美国前沿模型的能力。这些实验室通常通过代理服务(也称为“中转站”)路由请求来访问 Anthropic 的模型。为了绕过我们的地理限制和相关控制,这些代理服务使用虚假身份、伪造或被盗的信用卡以及被盗的 API 密钥创建了数千个新账户。
…
未经授权的实验室还通过从第三方转售商处购买用户与美国前沿模型的交流记录来获取这些记录。这些转售商包括代理服务的运营者,他们经常在用户不知情或未同意的情况下保存用户与美国模型之间的交流。
与此同时,一场持续不断的战争正在进行:Anthropic 试图阻止各种试图提取思维链的提示,而中国及其他攻击者则试图开发新的提取方法。
而且,情况更糟:
这些发现引发了人们对中国人工智能实验室滥用用户数据的担忧。DeepSeek、小米和 Moonshot 将他们自己的模型与用户之间的对话输入 Claude。
这些实验室随后将 Claude 的回复用作训练数据,以蒸馏 Claude 的能力。其中一些交流包含敏感信息,包括来自个人用户、大型跨国公司和与国家有关联的行为者的信息。许多此类交流是从美国和欧洲用户常用的第三方模型路由服务用户那里转发的。这些会话包含至少十几种语言的数百名最终用户的姓名、电子邮件地址、公司数据和其他敏感数据。这些做法很可能违反隐私法律以及这些实验室自己的服务条款。
报告中的例子包括要求 Claude 分析来自数百个中国摄像头的闭路电视监控录像,并暴露了俄罗斯政府的实时凭证。外面的情况可能会变得很糟糕。
你的回应可以是‘好吧,Anthropic 完全是在撒谎’,但除此之外,没有任何办法能为所涉行为开脱。
所有这些看起来都直接违反了众多法律,包括中国法律。
在许多此类案例中,至少 DeepSeek、Moonshot 和小米肯定违反了《个人信息保护法》第 39 条,而且很可能也违反了《刑法》第 235a 条:
《个人信息保护法》(PIPL):个人信息处理者向中华人民共和国境外提供个人信息的,应当向个人告知境外接收方的名称、联系方式、处理目的、处理方式、个人信息的种类以及个人向境外接收方行使本法规定权利的方式和程序等事项,并取得个人的单独同意。
此外,所有人都违反了《反不正当竞争法》,即通过“欺诈、胁迫或者规避、破坏技术或管理措施”的方式使用其他经营者合法持有的数据,从而扰乱市场竞争秩序。这似乎适用于此处。
哦,而且这一切还涉及普通正派欺诈,即《刑法》第196条和第177a条。
然后是《生成式人工智能服务管理暂行办法》第七条。
有六个具体案例。
阿里巴巴(Qwen)使用了一个庞大的虚假账号网络。
Moonshot(Kimi)通过一个庞大的虚假账号网络,秘密将用户对话发送给Claude。
DeepSeek也秘密将用户对话发送给Claude。
智谱(GLM)做了提取那件事,也做了虚假账号那件事,并且最近在GLM-5.3发布前还针对美国领先模型的网络能力进行了攻击。
小米利用保存的用户请求做了蒸馏那件事。
商汤、MiniMax等公司构成了第三方转售生态系统。
也就是说,所有酷小孩都在这么做。他们就是这样成为中国的酷小孩的。
中国人怎么拥有最好的开源模型?
GTG-16005:阿里巴巴(Qwen / 通义实验室)的思维链蒸馏与AI研发行动。
阿里巴巴的思维链蒸馏管道在每次请求中注入一个固定提示,迫使Claude在内联文本标签中写出其推理轨迹,然后再给出最终答案。这些思维链记录随后被保存并转换为可用于监督微调(SFT)的数据。这些SFT记录被用于帮助训练阿里巴巴的Qwen模型,并被用于将Claude的能力蒸馏到Qwen 3.5、3.6和3.7中。
阿里巴巴的非法蒸馏行动峰值达到每天近300万次对话
来自超过3,500个欺诈账号。…… 2026年5月至7月期间可归因于阿里巴巴的蒸馏攻击规模:观察到超过1.51亿次对话。
GTG-16002:Moonshot用Claude代替Kimi提供服务,并收集对话用于模型训练。
我们发现,生产Kimi系列模型的公司Moonshot AI,悄悄将客户请求转发给Claude,而不是使用Kimi进行处理。Moonshot随后向用户显示Claude的回复。这些用户以为自己在使用Kimi模型,却收到了Claude的回复。
在一个案例中,在十天时间内,Moonshot将近30万次客户请求转发给Anthropic,其中绝大多数被路由到Opus。Moonshot使用了一个由5,380个欺诈账号组成的代理服务网络,其中大多数似乎位于新加坡和日本。
除了向客户提供Claude的回复外,Moonshot还捕获并保存了这些对话中的至少一部分。
…… 在回复时,Claude会返回对其原始思考的引用,作为“思考签名”,而不是原始思考,以降低未经授权蒸馏的风险。
……2026年5月至7月期间可归因于 Moonshot 的蒸馏攻击规模:观察到超过 2300 万次交互。
Lyman Stone 石來民:好吧,在读完这些之后,我从“哇,Kimi 太糟糕了”转变为“为什么 Anthropic 要把这个不可思议的情报黑客行动抖出来”
不,Lyman。我理解你为什么会这么说,但我们不会窃取用户数据,即使该用户当时正试图使用 Kimi,而且某种程度上算是活该。
GTG-16001:DeepSeek 提供 Claude 而非自家模型的服务,并收集交互用于模型训练。
我们的调查发现,DeepSeek 也部署了与 Moonshot 类似的策略。DeepSeek 构建了一条思维链提取流水线,依赖上文所述的同一跨会话重放攻击。DeepSeek 还在未告知其客户的情况下,将交互静默转发给 Claude。与 GTG-16002 一样,其客户很可能并未被告知他们的请求正被输送给 Claude。
……2026年7月14天内可归因于 DeepSeek 的蒸馏攻击规模:观察到超过 1210 万次交互。
GTG-16006:智谱蒸馏、AI 研发及针对网络能力的目标锁定。
智谱,在中国境外以 Z.ai 为品牌,针对 Claude 运行了一条思维链提取流水线,将捕获的 Claude 推理轨迹通过 Claude 重放,以清洗这些轨迹用于训练其 GLM 模型。在短短十天内,智谱通过轮换 273 个欺诈账户来规避我们的模型限制,对 Claude Opus 4.8 发起了一条思维链提取流水线。
……智谱还利用 Claude 改进其自身的后训练流水线,使用 Claude 来评判模型输出,并清洗和规范化为
蒸馏而收集的推理记录。……更近一些,在其 GLM 5.3 模型发布之前,我们发现了一场针对美国领先前沿模型网络能力的行动。智谱的研究人员利用公开漏洞数据集开发了各种夺旗挑战。
智谱最初试图针对 Anthropic 的 Fable 模型的网络能力。Fable——Anthropic 最顶级的可普遍访问模型——已加强了网络
防护措施,使潜在的蒸馏者更难针对 Fable 的网络
能力。在 Anthropic 的网络
防护措施削弱了智谱的攻击之后,智谱最终放弃了针对 Fable 的尝试。……2026年6月和7月17天内可归因于智谱的蒸馏攻击规模:观察到超过 340 万次交互。
没错。他们试图强行蒸馏 Fable 的网络能力,以便将其植入一个开放模型。幸运的是,这没有成功,他们不得不转向防护措施较弱的 Opus 4.6。
GTG-16008:小米的蒸馏行动
这一次只有约 40 万条消息,使用保存的用户消息来播种交互。
我们的调查表明,小米可能在其 MiMo-V2-Pro 模型发布时推出了免费试用期——随后又延长了该试用期——意图利用国际开发者对该模型使用量的激增来蒸馏 Claude 的能力。针对 Claude 的大部分蒸馏攻击正是在试用期即将结束时开始的。
蒸馏 Claude 就是商业模式。
你打算怎么办,小子?
军备竞赛仍在继续。如果你想知道为什么你看不到思维链,部分原因是为了保护它免受类似《An Alien Mind》中所述的监督压力,但主要原因是避免蒸馏。
我们利用元数据并寻找异常活动的信号,以识别与代理服务网络相关的账户。
我们不会单独封禁代理账户,而是努力将这种可疑活动归因于某个特定组织,
从而使我们能够更有效地采取全面执法行动,以防止
蒸馏攻击。我们还构建了专门用于检测对抗性提取的分类器。
我们还增加了新的防护措施,使未经授权的实验室更难蒸馏
Claude 的能力。Claude 现在会在回应前总结其内部推理,这使得窃取的对话记录
对训练另一个模型的价值降低。……在我们调查和打击蒸馏攻击的过程中,我们所学到的将继续为
我们构建的防护措施提供依据。
Google 有一条条款,如果你试图蒸馏 Gemini,他们的计划是故意破坏
响应,以损害你的操作。我认为这是正确的政策。如果你有强有力的证据表明用户
在做犯罪的事,试图窃取你的东西,比如一个用于蒸馏的庞大欺诈账户网络,
那么是的,你应该能够搞他们,而不仅仅是封禁他们的账户。
我认为这与在用户尝试进行 AI 研发时悄悄降低响应质量的想法
截然不同。那是不可接受且充满敌意的,要么拒绝请求,要么不拒绝,
因为这可能会波及正常工作,现在每个人都得偏执地担心自己会被波及。
通过大规模欺诈账户网络进行的蒸馏和 CoT 提取攻击显然
不同。那不是你会意外触发的,也不是没有犯罪意图的。你知道你做了什么。
如果你玩这种游戏,你活该承受你得到的一切,甚至更多。
好消息,各位
总的来说,这份报告是好消息。是的,外面有坏人,试图做各种坏事。
偶尔他们确实做了坏事。但这一切加起来也没多少。我们乐于接受这种程度的恶意使用。
其中许多操作的细节相当疯狂。这只是一个简短总结。
当然,还有这个,尤其是考虑到没有提到朝鲜。
PoIiMath:“我们瓦解了报告中的每一项操作”
对这份报告的截然不同的解读
我把这份报告解读为主要是好消息,是在说情况基本还好,也因此不是什么大新闻。
同一周还有那么多其他看起来大得多的新闻。
Ryan Fedasiuk 不这么看。他夸大了自己的论点,声称这是各地
的头版新闻,但事实并非如此。但他认为,这件事,连同 NSA/CISA/FBI 关于蒸馏
努力的公告,从根本上改变了美中关系、中国对 Anthropic 的态度,
以及中国与其顶级实验室的关系。
我确实预计中国与其顶级实验室的关系会发生重大变化,此前有披露称
它们悄悄将大量消费者查询直接发送给 Anthropic,包括来自中国安全部门的
请求。
中国威胁要采取“坚决反制措施”以回应那份公告,就在完整报告于 10 日
发布的前一天。然后在 11 日,外交部的毛宁在简报会上确实特别回应了这份报告,
称中国反对试图“歪曲事实来抹黑中国”。
Ryan Fedasiuk:这里有一个低置信度的推测:我认为我们低估了中国官方媒体对中美在AI安全方面协调的敌意,可能正是对Anthropic的AI滥用报告的具体回应。
Anthropic的报告是我见过的最出色的情报产品之一。它不仅记录了一场世界历史性的中国反间谍失败——而且还在全世界每家报纸的头版上公开、个人地羞辱了中国的安全部门。
这对中国来说是一件极其重大的事。它将从根本上改变中国AI实验室与国家之间的关系。我仍然预计,那些被发现在其中国用户不知情的情况下将敏感请求直接路由到Claude的中国AI公司会遭到报复。
事实上,我确信这是Anthropic最初发布该报告时盘算的一部分。让中国安全部门难堪,并让从事蒸馏的中国实验室成为靶子,肯定是对这种做法的一种有效威慑。
但我也认为,这在一定程度上解释了我们所看到的中国官方媒体对Anthropic,尤其是对Dario的敌意。他们不仅将Anthropic视为美国AI的矛头,还将其视为一个热衷于抹黑和破坏中国政治体制的恶意行为者。
如果这种个人的、政治上的敌意现在渗透到关于中美在AI安全方面协调的更广泛讨论中,那将是不幸的——而事实上,我确实认为党关心AI风险,并将继续关心AI风险(参见国家安全部部长陈一新最近的评论)。
《中国日报》的一篇社论支持了这些反应相互关联的说法,尽管我只能想象,如果美国仅通过一份报纸的社论来代表——即便是《纽约时报》这样的报纸——那会是什么样子。
Julian Gewirtz:我今天还没看到有多少人关注《中国日报》这篇新社论。但它揭示了北京对呼吁AI减速的回应。
它明确将@DarioAmodei、@sama和@elonmusk的呼吁与Anthropic近期指控中国公司非法蒸馏的报告联系起来——将它们描绘成一场协同行动的一部分,目的是保护美国企业免受中国竞争。
Sam Altman说特朗普和习近平可能因AI协议获得诺贝尔和平奖:“我不觉得这有多难。这就像一份一页纸的文件。”但这是错的。即将到来的AI会谈将会“艰难”。这篇社论说明了原因。
标题其实已经概括了一切:“‘弗兰肯斯坦博士’美国AI精英的警报呼声是谋取私利的自利之举。”
《中国日报》的几句关键引述:
——“这份[蒸馏]报告,以及紧随其后的企业‘联盟’,本质上是一场协同操作——是对中国竞争以及来自华盛顿的监管压力的回应。其目标有三:削弱中国的AI进展,在国内赢得有利的政策环境,并维持投资者对美国AI的热情。”
——“当建造护城河的公司也被允许定义‘非法蒸馏’时,安全措施与竞争护城河之间的界限就可能变得模糊。”
——“这三家公司之间拟议的[‘为前沿定速’]协调,听起来更像是一个在公布宾客名单之前就已起草好入会规则的俱乐部。一个将中国排除在外的全球AI安全框架,算不上真正的全球。”
这篇社论并未排除外交途径,但正试图为即将到来的会谈设定条件。
关于中国对“为前沿定速”的回应,更多内容[见此处]。
Julian的完整报告称,中国将“为前沿定速”的呼吁解读为主要是为了拖慢中国。或者至少,这是他们嘴上说的。无论他们真实的姿态和理解程度如何,在峰会前你都会预料到他们会这么说。
Anthropic是美国AI实验室中对中国敌意最强的一个,将芯片和蒸馏问题上的强硬行动作为其整体战略姿态的核心部分。中国非常合理地将这一点,加上这类报告以及完全切断所有中国用户对Claude的访问,解读为敌对行为。这进而可能使中国更不愿意在灾难性或生存性风险上合作,因为他们同样容易犯这种认知错误。
我一如既往地提醒人们,不要倾向于把每一天的进展都当作会永久改变或固化态度、关系和冲突的事情。每个月看起来都与上个月大不相同。我已经记不清有多少次被告知棋局中的某一步‘不可避免地’导致了巨大的永久性变化,而没有这一步,事情或许会走向不同。这类说法几乎总是错的。
来源:Zvi Mowshowitz · thezvi.substack.com