跳到正文
Anthropic News·· 2026-08-07精选AI 评分62

Anthropic 更新 Claude Fable 5 生物安全防护,误拦率降低约 85%

Improving Fable 5's biology safeguards

AI 导读

Anthropic 更新 Claude Fable 5 的生物安全防护,通过重写分类器规则并重新训练,将生物学相关请求的 fallback 减少约 85%,日常健康与教育类问题如解读化验结果、理解症状将更少被拦截。Fable 5 仍会对病毒学、毒理学和分子设计等双用途请求回退到 Opus 5,因此暂不能用于专业生物学研究和药物开发。Anthropic 表示将继续通过可信访问渠道缩小这一差距。

推荐理由

原文给出生物安全分类器更新前后的误判率变化与仍受限的双用途范围,可据此判断前沿模型在敏感领域的开放节奏。

正文 · AI 翻译

我们正在更新 Claude Fable 5 的生物学安全防护措施,大幅减少误报。Fable 5 用户现在遇到的“回退”将大大减少——即在他们提出与生物学相关的查询后,系统切换到能力较弱的模型。在我们的测试中,此次更新使各产品界面中与生物学相关的回退减少了约 85%。1

因此,Fable 5 将能够协助更广泛的生物学任务。

实际上,用户在日常健康和教育问题上遇到的回退将大幅减少——例如解读化验结果、理解症状,以及在教育场景中学习生物学。医疗专业人员将能够在临床任务上获得 Fable 5 更多的支持。

我们相信,AI 对世界产生积极影响的最大机会在生物学和医学领域,我们正在大力投入,以负责任的方式让生物学家获得前沿能力。目前,对于我们认为具有两用性质的请求——包括病毒学、毒理学和分子设计——Fable 仍会回退到 Opus 5,因此它尚不能用于专业生物学研究和药物开发。我们致力于通过可信访问途径提供前沿生物学能力,来弥合这一差距。

我们为何构建强大的生物学安全防护

我们的目标是将 Fable 5 的前沿能力尽快交到尽可能多的用户手中。然而,要做到这一点,我们需要管理如此强大的模型所带来的日益增长的风险。其中一项风险就在生物学领域:Fable 5 如今在一些高度复杂的生物学任务上能够超越专家,并在其他任务上提供操作支持。这意味着它可以为开发新疗法的研究人员提供真正的帮助(这正是我们如此热衷于通过分类器改进和可信访问计划来扩大该模型访问范围的原因)。但若落入不法之徒手中,这些同样的能力可能被恶意行为者利用,例如用于开发生物武器。我们的能力评估显示,Fable 5 可以为这类行为者提供显著的提升——也就是说,它可以为他们提供在其他任何地方都无法获得的能力。

在生物学领域,区分 AI 的有益用途和有害用途往往很困难。例如,在某些情况下,研究某种疾病的治疗方法需要科学家制造出导致该疾病的危险化合物。这在活疫苗上最为明显,因为科学家需要培养他们旨在预防的同一种病原体。一些药物也是如此。为了开发治疗高血压的药物卡托普利,科学家分离出了蛇毒中能使人血压骤降的有毒成分。随着新的生物学能力在 AI 前沿不断发展,我们需要保持谨慎,确保其带来的新风险不会在其潜在科学益处之前成为现实。

那些企图利用我们的模型来造成伤害的老练行为者,深知如何利用这种模糊性来掩盖其意图,使危险的任务看起来像是普通的研究工作。美国情报界的2026年度威胁评估明确指出,此类行为者确实存在,并且包括合成生物学和基因组编辑在内的生物技术进步“可能导致新型生物威胁。”该评估指出,若干国家行为体可能维持着活跃的进攻性生物和化学武器计划——这些计划可能因获取前沿AI模型的原始能力而加速。

出于对这些“两用”能力(即既可用于有益目的也可用于有害目的、且两者之间的界限并不总是容易划清的能力)的担忧,我们有意在推出Fable 5时屏蔽了几乎所有生物学查询。这使我们能够将该模型提供给其他领域的用户使用。我们知道这会让合法的生物学用户感到沮丧:短期内会导致大量误报,即提出生物学相关问题的用户,其请求会被拦截并转交给能力较弱的模型。尽管如此,我们仍选择做出这一权衡,因为Fable在生物学这样的两用领域被滥用的代价可能是灾难性的。

我们的生物学防护措施如何运作

我们在生物学领域防范滥用的核心方式之一是通过安全分类器:即较小的自动化AI系统,用于检测Fable 5何时被要求执行受防护的生物学任务,或产生有害输出(我们此前曾撰文介绍过我们在网络安全领域的类似分类器)。

就Fable 5而言,当分类器触发时,模型会将用户的请求重新路由至Opus 5——一个能力不俗、但不具备Fable 5同等生物学能力、且无法为恶意用户提供同等程度协助的模型。这就是用户在其请求被拦截时所看到的回退方案。

开发精确、稳健的分类器并非易事。分类器要快速且一致地运作,就必须学会区分我们认为“在范围内”和“超出范围”的主题与查询——即我们认为可能有害的那些。调整分类器需要时间和反复迭代,既要避免误报(分类器对超出范围的内容触发),也要避免漏报(在范围内的内容被遗漏)。我们还要求分类器能够抵御绕过它们的尝试(即所谓的越狱),这需要更进一步的研究和测试。

从非常宽泛的生物学分类器入手,意味着我们可以在继续研究以完善它的同时,让用户使用Fable 5。另一种选择——在取得更多防护进展之前暂不发布该模型——会使模型的普遍开放及其对用户的潜在益处推迟数周或数月。

在过去几周里,我们仔细重写了分类器的章程(该章程由一系列规则组成,用于帮助模型区分受保护内容和允许内容),并特别细致地划定了良性用途。我们向来自 Anthropic 内部和外部的多元化专家征求了对这些修改的反馈。随后,我们基于该章程为分类器开发了更新的训练数据,并对其进行了重新训练,同时验证了新分类器总体上仍会对有害和两用研究生物学内容触发,但现在能够支持更广泛的良性和有益用途。

如下图所示,这些更新意味着——与 Fable 5 发布时相比——分类器会对远少得多的良性生物学相关请求触发。

我们的生物学分类器示意图。位于分类器边界左侧的内容被允许;位于边界右侧的内容受保护(因此会被阻止,并转而发送给能力较弱的模型);。明显有害的内容(红色)和两用内容(橙色)会触发分类器并被阻止。我们设置了一个安全边际,其中包含极可能良性但出于充分谨慎仍被阻止的内容(浅绿色)。明显良性的内容为深绿色。Fable 5 发布时,其分类器范围非常宽泛(A),会对大量请求触发——甚至包括几乎可以肯定良性的请求(即安全边际内的那些请求)。因此,分类器边界在示意图中非常靠左。我们今天宣布的更新(B)意味着分类器允许更多良性请求,它已能更好地区分良性查询与两用查询之间的细微差异。因此,示意图中的分类器边界已进一步向右移动。

结论

要完善我们的保护措施,仍有大量工作要做。误报仍将不可避免——即落在分类器安全边际内的请求,这些请求风险极低,但分类器仍会触发。正如我们上文所述,由于潜在的两用风险,Fable 将继续阻止两用专业生物学和药物开发查询。我们完全致力于为研究人员开发一条安全、可扩展的路径,让他们通过可信访问途径使用我们能力最强的模型。

我们希望您继续与我们分享反馈,以便我们进一步完善保护措施。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 应用,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究团队和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一个具有类似 CRISPR 特性的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com