MIT 提出 xvr 技术,将术中 X 光与术前 3D 扫描快速配准
New AI technique could make minimally invasive surgeries safer and more precise
MIT 及合作机构的研究人员提出 xvr(X-ray volume registration)技术,用患者术前 CT 或 MRI 生成合成 X 光来训练个体化 AI 模型,在数秒内完成术中 2D X 光与 3D 扫描的配准,精度达亚毫米级。
MIT 团队提出按患者个体适配的 2D/3D 配准方法,用物理模拟生成合成 X 光训练数据,读者可了解其精度与部署速度取舍。
研究人员创建了一种新技术,能够准确、快速地将手术过程中拍摄的X光片与患者的术前3D医学扫描进行匹配。这种方法可以让临床医生更容易精确操控微创手术工具,从而实现更快、更安全的手术。
临床医生在进行许多微创手术时,会使用实时X光片来帮助他们将导管和内窥镜等器械穿过微小的切口。但由于X光片是平面图像,要准确判断手术工具在患者体内的位置和方向可能很困难,从而增加了并发症的风险。
为了帮助定位手术器械,临床医生可能会手动将X光片与术前3D医学图像(如CT扫描或MRI)对齐。旨在简化这一过程的人工智能工具难以对所有患者都实现稳健的图像对齐,使其在实际应用中不可行。
这个新系统由麻省理工学院及合作机构的科学家和临床医生开发,使用一种AI模型,仅需约五分钟即可适应每位患者。该模型能在几秒钟内自动将一位患者的X光片与3D扫描进行匹配,且精度达到亚毫米级。
该系统被命名为xvr(代表X射线体积配准),在广泛的各类患者、身体部位和医疗手术中,其表现比现有AI方法高出一个数量级。
“大多数美国人距离能够执行非侵入性手术(如急诊卒中干预)的中心超过一小时车程。在卒中救治中,一小时极为关键。通过结合2D和3D信息使这些手术更容易进行,能够让这些高度专业化的救命手术惠及更广泛的人群,”麻省理工学院计算机科学与人工智能实验室(CSAIL)博士后、哈佛-麻省理工学院健康科学与技术项目近期毕业生、关于xvr的论文的第一作者Vivek Gopalakrishnan说。该论文今日发表于Nature。
与该论文合著的还有他的导师Polina Golland——Sunlin and Priscilla Chou电气工程与计算机科学(EECS)教授、CSAIL首席研究员、医学视觉组负责人、论文共同资深作者;以及Neel Dey——医学视觉组前博士后,现为哈佛医学院和麻省总医院研究员,也是论文共同资深作者。其他共同作者包括:哈佛医学院研究员兼临床医生David-Dimitris Chlorogiannis;St. Luke’s Marion Bloch神经科学研究所神经外科医生Andrew Abumoussa;Shriners儿童医院儿科临床医生Anna M. Larson;哈佛大学和布莱根妇女医院放射学助理教授Nazim Haouchine;波士顿儿童医院医生兼科学家Darren B. Orbach;以及哈佛大学放射学副教授Sarah Frisken。
让X光片提供更多信息
在许多微创手术中,例如用于开通阻塞动脉的血管成形术,临床医生通过一个微小切口插入器械,并使用高速移动X射线扫描仪生成图像,使他们能够从任意角度观察手术过程。
但要在不意外损伤其他组织的情况下引导手术工具,临床医生必须将实时 X 光影像与患者术前的 MRI 或 CT 扫描对齐。这一过程称为配准,有助于他们确定工具相对于解剖结构的位置。
“临床医生需要经过数十年的训练,才能熟练地看懂有颗粒感的 2D 图像并理解一切是如何定向的。我们希望让这些 2D X 光影像提供更多信息,从而让这些救生手术变得更安全、更容易,”Gopalakrishnan 说。
手动配准方法缓慢且繁琐,需要临床医生通过在计算机中输入数字或在屏幕上点击解剖标志来猜测手术器械的位置。
为了简化这一过程,研究人员正在开发能够预测 2D/3D 配准的 AI 模型。但人们的解剖结构差异极大,因此对某些患者效果良好的模型可能对其他患者失效。
Gopalakrishnan 说,缺乏高质量标注医学图像数据,使得训练一个足够稳健、能够适应众多患者的深度学习模型变得困难。
研究人员没有试图构建一个可应用于所有患者的机器学习模型,而是构建了一个专为特定患者极佳适配而设计的模型。
“我们为这一特定患者量身定制这一个特定模型,它是否适用于其他人并不重要,因为对那些人会有不同的模型,”Gopalakrishnan 补充道。
患者特异性机器学习
Xvr 获取一位患者的术前 3D 扫描(如 MRI 或 CT),并利用它从多个角度生成数千张合成 X 光影像,每秒约产生 1,000 张图像。它使用基于物理的 X 射线过程模拟,以确保这些合成图像逼真。
“不像某些类型的生成式 AI 那样从无到有生成数据,这种物理模拟完全基于该患者的 CT 扫描或 MRI。由于 xvr 以纯物理方式创建患者特异性数据,因此没有产生幻觉的空间,”Gopalakrishnan 说。
xvr 框架使用这些模拟数据来训练一个 AI 模型,该模型能在几秒内准确地将该患者的 2D X 光影像与其 3D 图像扫描对齐。
但是,尽管这样的配准模型高度准确,为每位患者从零开始训练却需要约 12 小时,使其无法在紧急情况下部署。为了加快这一过程,研究人员使用 xvr 预训练了一个更通用的 AI 系统,称为基础模型,它可以快速适应每位新患者。
他们收集了来自 2,000 多名患者的全身 3D 医学扫描,涵盖广泛的年龄、成像模态和身体区域。Xvr 使用这些多样化的数据生成合成 X 光影像,并训练一个基础模型来执行 2D/3D 配准。
这个预训练模型可以在约五分钟内适应一位新患者,并且其配准精度与从零开始训练时相同。
“所以现在你既能获得患者特异性的精度,又能在非常快的时间范围内完成,”Gopalakrishnan 说。
该团队在现有最大的真实 2D/3D 配准数据集上测试了该模型,其中整合了来自五家医院的数据,涵盖成人和儿科患者的数十块骨骼和器官系统。
Xvr 在准确性和鲁棒性方面显著优于其他基于 AI 的方法,同时其运行速度足以满足急诊手术的需求。该模型还可用于提升机器人手术技术的性能。
未来,研究人员希望专注于让 xvr 更快以实现实时部署,开展进一步研究以验证其在更多场景中的可靠性,并将该系统扩展到处理更复杂的情况,例如移动的身体部位。
“过去两年,我们一直在精心开发并验证这一算法。现在,我们正与手术机器人公司和临床团队密切合作,将这项研究转化为可用于导航或部署的实用工具,”Gopalakrishnan 说。
这项工作部分得到了美国国立卫生研究院(NIH)、MIT CSAIL-Wistron 项目、MIT-IBM 计算研究实验室、MIT Jameel 诊所、MIT 健康与生命科学协作组织以及 Chou 家族变革性研究基金的支持。
来源:MIT News · AI · news.mit.edu