UK AI Security Institute Blog·· 5 小时前AI 评分69
英国 AI 安全研究所与 Anthropic 等发布迄今最大规模数据投毒研究
Examining backdoor data poisoning at scale
AI 导读
英国 AI 安全研究所联合 Anthropic 和 Alan Turing Institute 发布迄今规模最大的数据投毒研究,测试了同一后门攻击在 600M 到 13B 参数四种规模模型上的效果。
正文 · AI 翻译
今天,我们发布了与 Anthropic 和 Alan Turing Institute 合作开展的研究成果,这是迄今为止规模最大的数据投毒研究。
数据投毒是指个人在网络上散布旨在破坏 AI 模型训练数据的内容,从而可能引发危险行为。它可以被用来植入后门;即使用特定短语来降低系统性能,甚至让模型执行诸如窃取敏感数据等被禁止的操作。由于语言模型是在海量公开互联网文本上训练的,几乎任何人都可以制造这类内容。
我们在四种不同规模的模型上测试了同一种后门攻击,参数规模从 600M 到 13B 不等。我们发现,少量文档(少至 250 篇)就足以成功“投毒”我们测试的每一个模型的训练数据,而所需数量并不会随模型或数据集规模而增加。此前的研究曾假设,攻击者需要污染一定比例的数据才能成功,但我们的结果表明并非如此。这意味着投毒攻击可能比之前认为的更可行。
随着模型能力不断增强,为防范数据投毒开展更多工作,对于确保其在各行业中的安全可信部署至关重要。我们发布这项研究,是为了提高人们对这些风险的认识,并推动其他人采取防御措施来保护自己的模型。
你可以在 Anthropic 网站上了解更多信息,或阅读完整论文。
我们正在招聘!如果你对领导研究以提升先进 AI 系统安全性充满热情,欢迎申请加入我们 Safeguards 团队担任研究科学家。
来源:UK AI Security Institute Blog · aisi.gov.uk