跳到正文
Anthropic Research·· 20 天前精选AI 评分68

Anthropic 用 Claude 优化 30 多个开源生物分子模型并开源代码

How Claude is uplifting biomolecular modeling

AI 导读

Anthropic 发布研究结果,Claude 在 Claude Science 中于不到四周内优化了 30 多个开源生物分子模型,平均提速约 4 倍,输出完全一致时约 1.6 倍。

推荐理由

Anthropic 用 Claude 在四周内优化 30 多个开源生物分子模型,并开源代码,可观察 AI 辅助科研工程的效率边界。

正文 · AI 翻译

在这篇文章中,我们分享 Claude 如何让科学家用于预测和设计生物分子的开源模型变得更快、更省内存。Claude 在 Claude Science 中工作,在不到四周的时间里优化了 30 多个此类模型,平均将其速度提升约 4 倍。它还创建了一种低内存模式,使得在单个 NVIDIA GPU 节点上就能准确预测超过 10,000 个 token(氨基酸、核苷酸,以及来自小分子和离子的原子)的生物分子系统。我们将全部优化代码开源,并宣布与 Adaptyv Bio 联合赞助一场蛋白质设计竞赛,提供最高 100 万美元的 Claude 额度支持,并为超过 5,000 个设计提供湿实验验证。最近,我们分享了结果,展示了 Claude 通过专家级地编排开源蛋白质设计和结构预测模型来设计从头蛋白质结合体的能力。从头结合体是通过计算设计的小型蛋白质,它们能紧密附着到特定靶标分子上,以激活、阻断或向其递送某种物质。

尽管这是对 AI 科学能力的一次令人鼓舞的展示,也是推进药物发现的早期一步,但它消耗的资源超出了绝大多数蛋白质设计者所能获得的资源。我们允许 Claude 在 AI 基础设施平台 Modal 上为每个靶标花费最高 10,000 美元,大致相当于 2,500 个 NVIDIA H100 GPU 小时。

为了让此类研究更易获取,我们开始探索推理优化,以更高效地运行这些模型。作为这些优化的早期成果,Claude Mythos 5.1 加速了七个开源生物学模型,使其运行速度最高提升 2.5 倍。

在此,我们展示新结果,说明一个内部的通用研究模型如何能够优化 30 多个为各种生物任务训练的深度学习模型,这些任务包括结构预测和蛋白质设计,以及基因组学和蛋白质语言模型。平均而言,Claude 能够将这些任务加速约 4 倍,同时仅牺牲极少的精度;在输出完全相同的情况下,加速接近 2 倍。Claude 还改善了这些模型的内存利用率,使得预测前所未有的规模的生物分子系统成为可能。通过将这些结果与我们对先前智能体蛋白质设计方法的简化相结合,我们表明 Claude 能够以少两个数量级的 GPU 小时,实现与我们此前报告的结果相当的计算机模拟性能。

除了蛋白质设计之外,这些专门的生物学模型还被分子生物学家广泛使用,包括用于药物发现和开发。我们今天将所有这类模型的优化代码开源(此处),以便更广泛的社区能够使用它们。你可以在我们的技术报告(此处)中找到更多细节。

为了进一步支持社区,我们还与 Adaptyv Bio 共同赞助了一场蛋白质设计竞赛,Adaptyv Bio 是 开放蛋白质设计竞赛 的先驱。我们共同选出了五个处于当今能力前沿的挑战性问题。与 Adaptyv 一起,并得益于 Modal 和 Twist Bioscience 的慷慨贡献,我们承诺提供最高 100 万美元的 Claude 额度、25 万美元的 Modal 计算额度,以及超过 5,000 个设计的湿实验验证。了解更多信息(此处)并(在此申请)。

加速蛋白质结构预测与设计模型

蛋白质结构预测是仅根据氨基酸序列确定蛋白质三维结构的问题。而蛋白质设计则是创建具有特定结构、功能或一组特性的蛋白质的过程。这些计算工具共同使科学家能够探究关键的生物分子过程,例如癌症如何形成,并创建有用的分子,例如可以靶向这些癌症的药物。

现代结构预测模型,如 AlphaFold3、OpenFold3 和 Boltz-2,将大部分计算运行时间和内存花费在两种操作上:三角注意力和三角乘法,它们作用于三元组 token。这些操作使得对生物分子系统的几何结构进行建模成为可能,但它们的计算成本极高,因为它们在运行时间和内存上都是三次方的:系统规模翻倍会使用 8 倍的时间和内存,而规模变为三倍则会使用 27 倍。

编写内核——用于 GPU 等加速计算硬件的底层软件转换层——是降低这些成本的标准方法。鉴于其重要性,三角注意力和乘法一直是专门内核开发工作的主题,最初是 NVIDIA 的 cuEquivariance,最近则是 NVIDIA 的 BioNeMo Inference Runtime(BioNeMo-IR)。

在我们自己优化结构预测模型推理的努力中,我们与 Claude 合作开发了 FlashPairformer,这是一组加速三角注意力和乘法的自定义内核。它达到了新的最先进水平,根据模型配置不同,在三角注意力上平均比 该领域标准 快 2.7-2.9 倍,在三角乘法上快 1.7-3.2 倍。

Chart showing Claude's kernel optimization
我们与 Claude 合作开发了 FlashPairformer,这是一组自定义内核,可加速三角注意力和乘法,它们是支撑最先进生物分子结构预测模型的 Pairformer 架构的主要组成部分。结果相对于 该领域标准 报告。

除了开发可迁移的内核外,我们还让 Claude 针对每个单独模型进行优化,以产生更具体的优化。这些包括缓存冗余的重复计算工作,以及将死分支简化为其常量输出等更改。这些改进的组合使结构预测模型平均加速了 4 倍,并且对于每个模型,我们都确认了 Claude 的加速版本没有影响下游任务(如结构预测)的性能。

通常,一个经验丰富的工程师团队需要数周时间才能为每个模型完成此类优化,而且这些工作往往无法在不同模型之间迁移。Claude 在 Anthropic 两位技术人员的监督下——他们具备生物分子建模经验,但此前没有推理优化或内核工程方面的经验——在不到四周的时间里完成了对 30 多个开源模型的加速,涵盖生物分子结构预测、蛋白质设计、蛋白质语言建模和基因组学。我们的结果表明,前沿 AI 模型将帮助该领域的其他人以更快的速度和更轻松的方式构建科学工具。

Bar chart showing Claude's accelerated optimizations over dozens of structure models
Claude 的优化加速了十多个生物分子结构预测模型,平均实现了约 4 倍的加速且精度下降极小,以及约 1.6 倍的加速且输出完全一致。注:ColabFold 1.6.3 同期发布的可选快速内核尚未在此进行基准测试。
Bar chart showing how Claude’s optimizations also sped up multiple protein design models spanning hallucination, structure generation, and inverse folding.
Claude 的优化还加速了多个蛋白质设计模型,涵盖幻觉、结构生成和逆折叠。这些模型依赖于多种架构,包括 AlphaFold 级结构变换器、扩散、流匹配和图神经网络。
Chart showing the performance of Claude's fast mode
我们为结构预测开发的快速模式,在一组汇总的生物分子界面上与默认设置相比在统计上无法区分。如果预测界面的 DockQ 分数大于 0.23,我们称其为可接受的。

实现大规模生物分子系统的建模

除了让这些蛋白质结构预测和设计模型更快之外,我们还让 Claude 减少建模大型分子机器时的内存占用。细胞中的许多工作都是由这类系统完成的,包括构建蛋白质的核糖体、为细胞提供能量的呼吸链复合物,以及帮助其他蛋白质折叠的分子伴侣。每一个都由数十个组件构成,其功能取决于这些组件如何组合和相互作用。预测如此大型系统的结构通常需要大量计算资源,而大多数分子生物学家无法获得这些资源,例如跨多个 GPU 节点的推理。

Claude 创建了一种低内存的“Big”模式,使得仅使用一个 NVIDIA GPU 节点即可对超过 10,000 个 token 的系统进行精确建模,并成功对超过 70,000 个 token 的系统进行推理——这在以前是无法完成的任务。使用 Big 模式成功折叠的分子机器包括人类线粒体复合物 I、TRiC 分子伴侣复合物、蛋白酶体和细菌核糖体,每一个都与其实验测定的结构高度吻合。据我们所知,这些是迄今为止使用结构预测模型准确折叠的最大结构之一,其中复合物 I 和 70S 核糖体各由超过 10,000 个 token 组成,相比之下,AlphaFold3 准确预测的 40S 核糖体由 7,663 个 token 组成。

Image of large molecular complexes created by Claude's "big" mode
Claude 创建的低内存“Big”模式使开源结构预测模型能够在单个 NVIDIA GPU 节点上准确预测由超过 10,000 个 token 组成的生物分子系统,表明这些专用模型能够在其训练上下文之外近 1.5 个数量级的范围内泛化。前三行显示准确预测的系统;底行显示预测不准确的系统。如果界面的 DockQ 分数至少为 0.23,则认为界面准确。

为了测试 Claude 优化的极限,我们要求 Claude 预测比以往任何已实现规模都更大的结构。使用单个 8-GPU B300 节点,Claude 生成了整个病毒衣壳和蛋白质区室的预测,规模从超过 31,000 到超过 70,000 个 token 不等。这些系统比这些结构预测模型的训练上下文大了近两个数量级,而且,也许并不意外的是,它们没有被正确预测。然而,由于现在只需要一个 NVIDIA B300 节点,在这种规模上进行推理的障碍已显著降低,这表明随着工具的改进,研究人员很快将能够对日益复杂的生物系统进行计算建模。

More images of large molecular machines
“Big”模式允许开源结构预测模型使用单个 NVIDIA B300 节点以前所未有的规模成功运行推理。能力运行以单次主干传递(无循环)执行,作为概念验证。预测的结构崩溃,表明在训练上下文之外近两个数量级处缺乏泛化。

Claude 高效设计 de novo 蛋白质结合剂

在我们早期的蛋白质设计工作中,我们为 Claude 提供了一个约 16,000 词的提示,鼓励它利用子代理,并在 24 小时内为每个目标在 Modal 上花费高达 10,000 美元(约 2,500 NVIDIA H100 GPU 小时)。在这里,我们让单个 Claude 模型访问一个 NVIDIA H200 和 24 小时的墙钟时间,一个约 1,100 词的提示,以及预装工具的参考表,没有子代理,也没有人类指导设计。

我们使用本文中描述的加速生物分子模型,针对 16 个目标运行了三个 Claude 模型(Mythos 5.1、Mythos 5 和 Opus 5)。我们通过 ipSAE 对设计进行评分,这是一种 计算机模拟 评分,已被证明可以预测湿实验室中的结合。在 16 个目标上平均,所有三个 Claude 模型评估的中位评分和最高评分设计所达到的 ipSAE 值与我们早期的 Mythos 5.1 活动大致相同,尽管使用的 GPU 小时数少了约两个数量级。我们还考虑了 Claude token 成本,发现通过在 GPU 和 token 上合计花费约 150 美元,我们可以实现与之前活动水平相匹配的 计算机模拟 性能。

Chart showing Claude's performance on de protein design on these optimized models compared to Mythos 5.1 compared
单个 Claude 模型在可访问一块 NVIDIA H200 和 24 小时挂钟时间的情况下,从头设计蛋白质结合剂,其计算机模拟结合评分与我们早先 Mythos 5.1 项目(虚线)相当,而后者可以使用子代理并消耗约 100 倍的 GPU 小时。每条曲线代表由 Claude 模型协调加速生物分子模型所得 ipSAE 评分(计算机模拟结合评分)的中位数(上)或最大值(下)。我们展示了评分与估计 GPU 花费(左)、token 花费(中)及其组合(右)的关系。结果是对 16 个靶标、每个靶标最多五次独立运行取平均。

与 Adaptyv Bio 联合赞助蛋白质设计竞赛

上述优化帮助我们更高效地预测和设计分子,同时解锁了原本因资源限制而无法实现的能力。为了展示它们带来的提升以及 Claude 在分子设计领域更广泛的影响,我们正与 Adaptyv Bio 合作推出一项蛋白质设计竞赛。我们选出了当今蛋白质设计能力前沿的五个问题,包括物种交叉反应性、pH 敏感性和肽-MHC 特异性等挑战,以及 GPCR 等困难靶标。

我们将与 Adaptyv 团队一起,对社区针对这些问题提交的 5,000 多个设计进行实验验证。我们将为参与研究者提供最高 100 万美元的 Claude 额度以及用于在 Adaptyv 进行实验验证的额外资金,Modal 将提供最高 25 万美元的计算额度,Twist Bioscience 将为竞赛提供 DNA。你可以在此处找到更多信息,包括资格标准(这里)和(在此申请)。

我们还已开始通过我们的生命科学验证计划,为生命科学家提供用于生物学相关工作的前沿 AI 能力。我们最近招募了第一批组织,并于今天以公开测试版开放该计划。你可以(在此)找到更多信息。

延伸阅读

以下资源提供了关于上述结果的进一步技术深度和更详细信息:

相关内容

Claude 形状的科学

客座作者 Matthew Schwartz 教授描述了当他不再与 Claude 对抗,并允许 Claude 去寻找“Claude 形状”的问题——即最适合当前一代 LLM 工具能力的问题——时发生了什么。这促使他构建了 BootLoops,一个用于定量科学中精确计算的工具包,他一直在与专家一起将其应用于各个科学领域。

阅读更多

机器人能做什么工作?

我们构建了一个指数,用于衡量当今机器人执行美国工作任务的能力。机器人已经可以完成四分之三的体力任务,但大多是在受限环境中,而仅在 0.3% 的任务上具有成本竞争力。

阅读更多

你想从 AI 得到什么?

我们正在启动一项新研究,使用 Anthropic Interviewer 来了解你与 AI 相处的经历。

阅读更多

来源:Anthropic Research · anthropic.com