跳到正文
MIT News · AI· Adam Zewe | MIT News·· 2026-07-13精选AI 评分62

MIT 新方法无需生成内容即可识别被微调用于生成 CSAM 的模型

New method aims to keep kids safe from illegal AI-generated content

AI 导读

MIT 团队联合 Thorn 等机构提出一种审计方法,通过分析 LoRA 适配器对模型内部计算的改动,在不生成任何输出的情况下判断模型是否被专门微调用于生成 CSAM,测试中对三类模型的识别准确率达 100%。

推荐理由

MIT 团队提出无需生成内容即可审计模型是否被微调出有害能力的方案,为平台审核开源模型提供可扩展路径。

正文 · AI 翻译

随着生成式人工智能的爆炸式流行,如今网上有许多开源模型可供任何人针对自己的任务进行调整,例如以某种艺术风格生成产品渲染图。 

但这些模型也会落入不法分子之手,他们可能对其进行优化以生成非法内容,例如仇恨言论或儿童性虐待材料(CSAM)。这是一个日益严重的问题——美国国家失踪与受虐儿童中心在2025年收到了超过150万份报告,涉及AI生成的CSAM,而2024年这一数字为67,000份。

工程师通常通过向模型输入提示词并检查其输出来测试AI的有害能力,但对于CSAM而言这是不可能的,因为在美国,无论意图如何,生成此类内容都是违法的。

为了避免这一困境并提升AI安全性,副教授Ashia Wilson和她的研究生Vinith Suriyakumar与MIT健康机器学习实验室(由Marzyeh Ghassemi领导)以及儿童安全非营利组织Thorn的研究人员合作,开发了一种新的审计方法,无需向模型输入提示词即可判断其是否能生成CSAM。Thorn是一家儿童安全非营利组织,其使命是改变数字时代保护儿童免受性虐待和性剥削的方式。

他们的技术检查模型内部机制是如何被调整的,但从不生成输出。通过检查隐藏表示,它可以可靠地推断出模型是否已被专门化以生成有害图像。

在测试中,该审计程序以100%的准确率识别出了被专门化用于生成CSAM的模型变体。托管平台可以利用这一技术标记不安全的模型并迅速将其移除,或从一开始就阻止其被上传。

“这为托管开源模型的平台和执法部门开辟了一条新途径,可以真正测试模型是否有能力生成CSAM。以前,我们无法衡量这一点。这是一个巨大的盲区,有些人正在利用它。现在,我们可以解决一个正在产生严重负面影响的AI安全问题,”MIT电气工程与计算机科学(EECS)研究生、该技术论文的第一作者Vinith Suriyakumar说。

Suriyakamur和Wilson(EECS的Lister Brothers职业发展教授、信息与决策系统实验室(LIDS)的首席研究员、资深作者)与MIT博士后Lena Stempfle、Ghassemi(EECS副教授、医学工程科学研究所(IMES)和LIDS成员)以及波士顿大学和Thorn的其他人员共同撰写了这篇论文。该论文在国际机器学习大会的“可信AI向善”研讨会上作为焦点报告进行了展示。

审计适配

近期的技术使用户更容易通过一种称为微调的过程,将生成式AI模型专门化用于自己的任务。 

个人无需在任务特定数据集上重新训练整个模型,而是可以利用一种称为低秩适配(LoRA)的算法,以更高效的方式对模型进行专门化。

这引发了一波面向各种用途的新型生成式 AI 模型变体,例如生成模仿某种艺术流派的水彩画。但它也让恶意行为者能够创建可生成高质量 CSAM 及其他有害图像的模型。

为了审计一个模型,工程师通常会向它提示有害内容并检查其输出,但这种人工审计流程无法规模化。此外,反复生成令人发指的图像会对人类评估者造成负面心理影响。 

在测试 CSAM 时,这种评估方法很快就行不通了,因为在美国和许多其他国际司法管辖区,出于任何目的生成 CSAM 都是违法的。

“我们正处于这种非常困难的境地:根据法律本身,我们无法使用事实上的评估手段。我们不得不抛弃整套工具包,另辟蹊径,”Suriyakumar 说。

在了解到这一难题后,研究人员与 Thorn 联手来解决这个问题。

一种非生成式解决方案

研究人员没有关注输出,而是针对 LoRA 算法在微调过程中所做的修改。 

他们的技术探测这些被称为 LoRA 适配器的修改,以判断一个模型是否已被专门化用于某种有害能力,而无需生成输出。

研究人员使用一种称为高斯探测的技术,向模型输入一组随机数据点,并分析它如何在多层内部结构中处理这些数据。 

“我们从不让模型运行到底,也不向模型提示,因此我们从不生成图像,”Suriyakumar 解释道。

研究人员在模型内部结构的多个时间点捕获这些修改,并对它们取平均,以概括 LoRA 适配器如何改变了模型的计算。他们发现这些响应是模型如何被专门化的强信号。

他们在三类模型的变体上测试了他们的方法,并将结果与已知用于生成 CSAM、其他有害图像和安全内容的 LoRA 适配器的真实数据进行了比较。 

他们的方法在识别被适配用于生成 CSAM 的模型方面达到了 100% 的准确率。 

“AI 带来了大量儿童安全方面的担忧,这些是真实存在、需要解决的担忧。许多儿童正受到 AI 深度伪造的伤害。我们已经证明高斯探测可以成为一个非常有用的工具,我们希望研究界真正对这个问题投入更多关注,”Wilson 说。

重要的是,他们的技术可扩展,且实施成本相对较低。由于每月有数千个模型变体在网上发布,可扩展性是帮助审计人员在这些有害适配被广泛传播之前将其移除的关键。

高斯探测也比其他一些审计技术更稳健,因为恶意行为者需要精心修改基础模型的内部运作才能避免被检测到。

未来,研究人员希望在一个更大的模型变体集合上评估他们的技术,并探索高斯探测是否能在基础模型被适配之前检测出其中的有害能力。

“现在我们有一种技术方法可以部分解决这一问题。这次合作投入了大量精力,使我们能够应对一个真正棘手的难题,这个难题正在全国乃至全世界伤害着众多儿童。希望我们能在这一领域产生变革性影响,”Ghassemi 说。

这项工作部分得到了 Bridgewater AIA Labs Research Fellowship 的支持。

来源:MIT News · AI · news.mit.edu