跳到正文
MIT News · AI· Adam Zewe | MIT News·· 2026-08-04精选AI 评分60

MIT 研究:医疗 AI 辅助效果因使用者专业水平而异

The benefits of medical AI assistance vary based on user expertise

AI 导读

MIT 等机构在《Nature Medicine》发表研究,测试非专家与初级保健医生在皮肤疾病诊断中使用不同可解释 AI 方法的效果。结果显示所有可解释方法都提升了非专家准确率,但主要源于对 AI 的盲从,LLM 解释带来的盲从最强,且解释越笼统越有说服力;临床医生则不受错误解释干扰,仅给出模型预测而不附解释时表现最好。

推荐理由

研究对比四类可解释 AI 方法在皮肤诊断中的效果,揭示同一解释对专家与新手的作用相反。

正文 · AI 翻译

在设计辅助用户进行疾病诊断的人工智能系统时,一刀切的方法很可能不是最佳策略。

麻省理工学院及其他机构研究人员的一项新研究发现,虽然AI辅助总体上提高了非专家和临床医生诊断皮肤疾病的准确性,但AI可解释性方法的影响因用户的知识水平而异。 

可解释AI方法通过描述或验证模型的决策过程,帮助用户判断何时该信任模型的预测。例如,模型可能使用热图来突出对其诊断最重要的图像区域,或使用大型语言模型(LLM)用通俗语言解释预测结果。

在这项研究中,研究人员测试了非专家和初级保健提供者在皮肤疾病诊断中的表现,分别在有和没有不同可解释AI系统帮助的情况下进行。 

他们发现,非专家的诊断准确性有所提高,但这很大程度上归因于对AI系统的顺从。非专家无论LLM解释是对是错都予以信任,并且认为模糊或笼统的解释更有说服力。

相比之下,临床医生没有被错误的AI辅助所误导,并且在仅提供模型预测、不附带任何解释时表现最佳。 

“好的AI系统可以在某些医疗场景中提升表现,但这必须与可能导致更多错误的算法顺从性仔细权衡。我们知道AI和可解释性方法都可能引发人类的自动化偏差,这种锚定效应是我们在设计AI系统时必须考虑的因素,”麻省理工学院电气工程与计算机科学系(EECS)副教授、医学工程与科学研究所成员、信息与决策系统实验室及Abdul Latif Jameel健康机器学习诊所的首席研究员Marzyeh Ghassemi表示。

“这些发现很重要,因为患者越来越多地求助于AI来帮助他们的医疗保健。我们的研究结果表明,当可解释AI模型给出错误输出时,医学知识最少的人最容易被误导,”共同作者、斯坦福大学生物医学数据科学与皮肤病学助理教授Roxana Daneshjou表示。

研究人员表示,这些结果凸显了在构建AI系统时考虑用户需求的重要性,以及开发鼓励批判性思维而非过度依赖模型的可解释性方法的重要性。

“越来越明显的是,我们不能仅仅假设一个好的AI就能解决所有问题。我们需要仔细关注将使用AI系统的用户,因为同样的解释可能帮助专家却误导初学者。通常,最可能从AI中受益的人恰恰是最容易被其误导的人,因此我们如何呈现建议与建议是否正确同样重要,”第一作者、哥伦比亚大学生物医学信息学系助理教授Orson Xu表示。

与Ghassemi、Xu和Daneshjou共同撰写该论文的还有许多作者,包括麻省理工学院研究生Haoran Zhang、本科生Reina Wang、2020届博士Luis Soenksen(Jameel诊所的研究附属人员),以及临床医生和研究人员。该工作的描述今日发表于Nature Medicine。

探索解释方法

一些经 FDA 批准的人工智能界面正被用于帮助临床医生在医学图像中识别皮肤疾病,以简化早期诊断。除了预测图像中是否存在疾病外,这些工具通常还会使用几种方法之一来解释模型的决策过程。

与此同时,非专业人士可以使用基于 AI 的搜索引擎自行进行数字诊断,这些引擎根据用户提示预测皮肤疾病。这些系统通常使用 LLM 以更简单的语言解释模型的预测。

研究人员探索了这些可解释 AI 工具在皮肤疾病检测中对初级保健医生和非专业人士的影响及潜在益处。他们通过向用户展示医学图像以及 AI 对皮肤疾病的预测来测试用户,并采用了不同的可解释 AI 方法。 

这些方法包括:仅给出 AI 预测和置信度而不提供解释;提供相似图像以强化其预测的方法;突出重要图像区域的热图方法;以及用通俗语言解释模型推理的 LLM。

非专业人士的任务是判断一张皮肤痣图像是否为癌性,分别在有和没有可解释 AI 帮助的情况下进行。临床医生则被赋予更具挑战性的任务:提供皮肤疾病鉴别诊断。

研究人员发现,所有可解释 AI 方法都提高了非专业人士的准确性,主要是因为这些工具有助于用户诊断非癌性痣。 

此外,当他们采用旨在对抗深色皮肤偏见的公平约束模型时,系统显著提高了准确性,并减少了基于肤色的诊断差异。

“但非专业用户表现更好的原因是他们更依赖模型。当模型出错时,它对性能的损害大于模型正确时带来的帮助。我们只是能够为这一场景训练出非常好的 AI 模型,”Ghassemi 说。

这种顺从效应在 LLM 解释下最为明显,用户在 LLM 辅助下对自己的错误答案更加自信。

另一方面,临床医生对错误的 AI 解释具有抵抗力,并且在所有可解释性方法中,LLM 对其准确性的提升最小。

“这实际上取决于每个群体如何使用解释。临床医生心中已有诊断,并对照自己的训练来检查 AI,因此糟糕的解释会被识破。与此同时,非专业人士可能正是用同样的解释来首先形成观点,因此一个看似合理、语气自信的理由可能将他们引向错误答案。同一个工具最终对一类用户是资产,对另一类用户则是负担,”Xu 说。

克服顺从效应

当研究人员深入探究时,他们发现,对 AI 辅助最顺从的用户,在没有 AI 帮助时任务表现最差。 

他们还发现,向用户呈现 AI 解释的时机影响了他们的行为。如果先给出解释,在用户能够自行进行诊断之前,他们往往会变得更加顺从模型。

此外,当疾病表现微妙时,AI 系统表现优于人类,但如果图像中存在非典型症状或无关特征,人类表现则好得多。

综合来看,这些结果表明可解释人工智能可能导致对模型的过度依赖,并让用户即使在人工智能建议错误时也盲目遵循。 

与其使用大语言模型生成更详细的解释,不如先强制用户给出诊断假设,然后提供基于人工智能的建议以突出其他可能的病症供考虑,这可能更有效。 

“我们真正希望人工智能提升创造力,要么提升技能,要么填补用户遗漏细微表现的空白。否则,我们就有可能陷入自动化偏见,然后当模型出错时,用户无法恢复,”Ghassemi 说。 

这项研究部分由美国国家科学基金会、施密特科学、美国国家经济研究局和哥伦比亚大学资助。

来源:MIT News · AI · news.mit.edu