Prime Intellect 等发布 7B 宏基因组基础模型 METAGENE-1
METAGENE-1: Metagenomic Foundation Model
USC、Prime Intellect 与 Nucleic Acid Observatory 联合发布 7B 参数的宏基因组基础模型 METAGENE-1,基于超过 1.5 万亿碱基对的人类污水 DNA 与 RNA 序列预训练,用于疫情监测与病原检测。
我们发布了一个70亿参数的宏基因组基础模型,专为流行病监测而设计,基于从废水中测序的超过1.5万亿碱基对的DNA和RNA进行训练。
- 论文:metagene-1-paper
- Github:github.com/metagene-ai
- Hugging Face:huggingface.co/metagene-ai
一项合作 ,由USC、Prime Intellect和核酸观测站的研究人员共同完成。
概述
我们预训练了METAGENE-1,一个70亿参数的自回归Transformer语言模型,我们将其称为宏基因组基础模型,训练语料是一个全新的多样化宏基因组DNA和RNA序列数据集,包含超过1.5万亿碱基对。
该数据集来源于大量人类废水样本,使用深度宏基因组(下一代)测序方法进行处理和测序。与专注于单个基因组或特定物种精选集合的基因组模型不同,METAGENE-1的目标是捕捉人类微生物组中存在的基因组信息的完整分布。该模型旨在辅助与流行病监测、病原体检测和新发健康威胁早期发现相关的公共卫生应用。
我们对数据集进行字节对编码(BPE)分词,专为宏基因组序列定制,然后预训练我们的模型。我们在技术报告中详细介绍了预训练数据、分词策略和模型架构,重点阐述了实现对宏基因组数据有效建模的考量和设计选择。

数据
METAGENE-1在一个新收集的宏基因组数据集上进行训练,该数据集包含来自非常广泛范围(例如,数万种)生物的材料,通过人类废水(即,市政进水)的宏基因组测序收集而来。这种方法与先前的基因组序列模型形成对比,后者通常专注于特定物种或基因组类型的精选集合。

我们在上图中展示了宏基因组数据收集和测序流程。该过程从收集废水开始(左侧),其中包含来自多样化物种集合的基因组片段(中间)。通过高通量宏基因组测序进行处理,产生数百万条双端读长(右侧),每条由数百个碱基对组成。完整数据集包含超过1.5万亿碱基对的宏基因组序列,用于模型预训练。

性能
METAGENE-1在病原体检测和宏基因组嵌入基准测试以及其他标准基因组评估任务上取得了最先进的性能——这些任务旨在评估模型在人类、动物和其他基因组上的表现——凸显了其泛化能力。

作为下游应用潜力的初步展示,我们构建了病原体和异常检测场景,并展示了METAGENE-1在这些检测任务上的能力。详情请参阅我们的技术报告。
安全性
METAGENE-1 提供对生物监测和宏基因组异常检测有价值的能力。虽然当前版本的模型由于数据和架构选择而风险极小,但我们仔细权衡了其益处与潜在滥用风险,特别是在合成生物学领域,并强调对更大、更强大的模型需要严格的安全考量。在我们的技术报告中,我们讨论了发布宏基因组模型的安全考虑。
目的与能力:METAGENE-1 专门优化用于检测短宏基因组读取(100-300 碱基对)中的异常,使其非常适合病原体检测和生物监测等任务。该模型的架构选择,如其 512 个 token 的上下文长度,限制了其适用于复杂序列设计任务,降低了滥用风险。
开源影响:我们相信 METAGENE-1 的开放发布将通过为科学家提供有价值的工具来促进病原体检测和生物监测的研究,同时也将促进科学基础模型的研究。然而,我们强调未来在开源更大或更强大的基因组模型之前需要进行严格的安全评估,并正在为此开发一套安全基准。
团队
METAGENE-1 由来自 USC、Prime Intellect 和 Nucleic Acid Observatory 的研究团队为您呈现:
- Oliver Liu,USC
- Sami Jaghouar,Prime Intellect
- Johannes Hagemann,Prime Intellect
- Shangshang Wang,USC
- Jason Wiemels,USC
- Jeff Kaufman,Nucleic Acid Observatory
- Willie Neiswanger,USC
来源:Prime Intellect Blog · primeintellect.ai