LangChain 发布 Deep Life Sci:面向生命科学的开源智能体助手
Building an Agent Harness for Life Sciences: Introducing Deep Life Sci
LangChain 发布 Deep Life Sci,一个基于 Deep Agents harness 构建、面向临床与实验室科学家的开源智能体助手,可访问 ClinicalTrials.gov 超 60 万项注册研究、PubMed 2900 万篇摘要和 PubMed Central 1200 万篇全文,并通过子智能体同时审阅数百份文档。
原文给出开源智能体在生命科学场景的数据接入与可定制路径,可据此判断领域专用 harness 的落地方式。
Eroom 定律(提示:把 Eroom 倒过来读)是摩尔定律的邪恶双胞胎。过去 70 年间计算能力价格的指数级下降,为我们带来了个人电脑、互联网、手机,以及如今的人工智能革命。不幸的是,药物研发却朝着相反的方向发展,每种新药的研发成本每九年就翻一番。
AI 智能体有望扭转这一趋势,但通用型解决方案并不具备生命科学组织所需的领域专属性。正因如此,我们开发了 Deep Life Sci:一个专为临床和实验室科学家打造的开源智能体助手。

药物研发成本加速攀升
制药领域失控的成本增长来自药物开发流程的两个阶段:临床前研究和临床试验。识别有前景的药物靶点,需要从数百万篇科学论文和庞大的生物数据集中筛选洞见。一旦某个候选分子显示出安全有效的可能,它便进入人体临床试验阶段,此时必须完成数万页的文书工作,以确保符合日益增多的 FDA 法规。
许多 AI 公司承诺其工具将帮助恢复研究生产力,但像 Claude 和 ChatGPT 这样的通用型 AI 助手缺乏必要的领域知识,也无法与科学数据源集成。而面向生物技术的更专业 AI 产品往往收取高额加价。
在这两种情况下,智能体框架都是专有的,用户无法对其进行定制,并被锁定在昂贵的闭源模型中。这一问题在生命科学领域尤为关键,因为 GxP 验证要求有完整的文档和审计日志,能够说明系统为何如此行为,这要求企业对用于驱动临床决策的任何系统拥有完全的控制权。
面向生命科学的开源智能体助手
在 LangChain,我们相信拥有自身智能的组织将占据优势。我们开发了 Deep Life Sci,一个面向临床和实验室科学家的开源智能体助手,构建于我们的 Deep Agents 框架之上,作为供企业采用并根据自身用例进行修改的模板。
Deep Life Sci 可以访问 ClinicalTrials.gov 上超过 60 万项注册研究的临床试验记录、通过 PubMed 获取的 2900 万篇论文摘要,以及 PubMed Central 上的 1200 万篇全文文章,并通过将文档分配给子智能体来同时审阅数百份文档。每个智能体都配备一个 LangSmith 沙箱,使其能够安全地运行代码以执行任意数据分析。用户可以上传 PDF、图像、表格数据文件、RIS 等文献文件、SMILES、FASTA 等序列文件等,供智能体纳入其工作。

Deep Life Sci 的示例智能体工作流
在一个典型工作流中,实验室科学家完成 RNA-seq 或蛋白质组学筛选后上传结果表。智能体在沙箱中运行富集分析以识别差异表达基因,然后检索文献寻找每个命中基因与表型相关的先前证据,将已有充分研究的基因与新颖基因区分开来,并返回一张带有支持文献的排序表格。

另一方面,临床开发或 HEOR 团队可能需要找到某个适应症中标准疗法的每一项已发表试验,并一致地提取终点值、N、人群特征和随访时长。该 agent 会执行检索、按标准筛选、将每项试验提取到统一 schema 中,并同时生成表格和森林图式对比。

在临床试验阶段,会产生数千页不同类型的文档,包括知情同意书、临床方案文件及修订、病例报告表等——所有这些在最终定稿前都必须经过多次彻底审计、审阅和编辑。使用 Deep Life Sci,用户可以上传参考方案文档,研究并收集额外的统计信息,并快速整理必要的反馈和修改,最终可显著缩短临床文档处理时间。
在研发中拥有你自己的智能
当该 agent 被优化并集成到公司生态系统中时,Deep Life Sci 的价值会进一步放大。Deep Life Sci 知道主要终点是什么,但它不知道公司特有的细微差别,例如内部检测结果、监管机构曾对哪些终点提出异议,或哪些试验中心实际入组了患者而不仅仅是承诺入组。
将这种上下文集成到 harness 中,就是在实践中拥有你自己的智能的样子,而由于 Deep Life Sci 的代码是开源的,组织可以按自己的意愿来实现这一点。这种定制可以包括添加与内部数据和文档的集成、利用不同的前沿模型和开源模型、实施护栏和审批门禁等。
修改 harness 会让你置身于 agent 开发生命周期(ADLC)之中:构建、测试、部署、监控,然后将你学到的东西反馈到下一个版本中。追踪和评估有助于驱动这一开发循环。
追踪:了解你的 agent 在做什么
每一次 Deep Life Sci 运行都会在你自己的 LangSmith 账户中端到端记录,包括该 agent 发出的文献检索、它在沙箱中运行的代码、每个子 agent 读取的文档,以及它如何从这些内容得出答案。这些轨迹可用于调试和改进该 agent,并可作为审计记录。
评估:持续改进你的 agent
评估会告诉你对 agent 的某项更改是否提升了其性能。Deep Life Sci 附带一个默认评估集,你可以随着添加集成和识别新用例对其进行修改和扩充。在你更换模型或重写提示词前后运行该评估集,你就会看到新版本究竟是真正改进了,还是悄悄退步了。
Agentic AI 已经在彻底改变编程和数学等领域。生物医学——其成本效益和迭代速度直接转化为挽救的生命——不应被落下。将 Deep Life Sci 等开源工具与 LangSmith 的 ADLC 能力相结合的生物技术和制药公司,可以通过在整个药物开发周期中实现成本节约和更快迭代,扭转 Eroom 定律。
在此开始使用 Deep Life Sci。
来源:LangChain Blog · langchain.com