跳到正文
Anthropic News·· 2025-08-21精选AI 评分60

Anthropic 与美国 NNSA 合作开发核扩散风险分类器

Developing nuclear safeguards for AI through public-private partnership

AI 导读

Anthropic 宣布与美国能源部国家核安全管理局(NNSA)及 DOE 国家实验室合作,共同开发了一个用于区分核相关对话是否值得关注的分类器,初步测试准确率达 96%。

推荐理由

Anthropic 与美国 NNSA 联合开发核扩散风险分类器并已上线 Claude,展示了公私合作做前沿模型安全防护的路径。

正文 · AI 翻译

核技术本质上具有双重用途:为核反应堆提供动力的同一物理原理可能被滥用于武器研发。随着AI模型能力日益增强,我们需要密切关注它们是否会以可能威胁国家安全的方式向用户提供危险的技术知识。

与核武器相关的信息尤为敏感,这使得仅靠一家私营公司独自评估这些风险颇具挑战。因此,去年四月我们与美国能源部(DOE)下属的国家核安全管理局(NNSA)合作,评估我们的模型在核扩散方面的风险,并继续与他们共同开展这些评估。

如今,我们已超越风险评估,开始构建监测风险所需的工具。我们与NNSA及DOE国家实验室共同开发了一个分类器——一种能自动对内容进行分类的AI系统——在初步测试中,它能以96%的准确率区分值得关注的与良性的核相关对话。

我们已将这一分类器部署到Claude的流量中,作为我们识别模型滥用行为的更广泛系统的一部分。早期部署数据表明,该分类器在真实的Claude对话中表现良好。

我们将与前沿模型论坛(前沿AI公司的行业组织)分享我们的方法,希望这一合作能成为一份蓝图,供任何AI开发者参考,与NNSA合作实施类似的防护措施。

除了保护前沿AI模型免遭核滥用这一具体重要性之外,这项史无前例的努力还彰显了公私合作的强大力量。这些合作将产业界与政府的互补优势结合起来,直面风险,使AI模型对所有用户而言更加可靠和值得信赖。

关于我们与NNSA合作及防护措施开发的完整细节,可在我们的red.anthropic.com博客上找到,该博客是Anthropic前沿红队(偶尔也包括Anthropic其他团队)发布前沿AI模型对国家安全意味着什么的研究之地。点击此处阅读更多。

相关内容

Anthropic投资1亿美元培训1万名工程师,以弥合企业AI人才缺口

Anthropic正在向Claude Frontier Academy投资1亿美元,计划到2027年底培训1万名前沿部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。

阅读更多

巴克莱银行扩展Claude应用,以升级运营并改善客户体验

英国全能银行巴克莱正在扩大与Anthropic的战略合作,将安全的企业级AI系统整合到其全球运营中。

阅读更多

Claude发现一种具有类CRISPR重复序列的新型酶系统

我们宣布在Anthropic成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:Claude仅在我们科学家提供高层指导的情况下,发现了一种特性令人联想到CRISPR的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com