评估医学图像基于多选项任务的LLM的幻觉和诊断可靠性
IEEE journal of biomedical and health informatics
|October 15, 2025
概括
评估医疗诊断的大型语言模型至关重要. 虽然一些模型显示了准确性,但它们的推理往往缺乏临床依据,突出了除了正确答案之外的解释能力的需要.
科学领域:
- 人工智能在医学中的应用
- 生物医学信息学 生物医学信息学
- 医学成像分析 医学成像分析
背景情况:
- 大型语言模型 (LLM) 越来越多地被整合到医疗保健中,为诊断支持提供了潜力.
- 评估LLM推理的可靠性和临床依据对于在敏感决策中安全应用至关重要.
- 当前的评估往往侧重于诊断的准确性,忽视了基础推理过程的质量.
研究的目的:
- 提出一个系统的框架来评估医疗图像基础任务中LLMs的诊断正确性和解释质量.
- 评估各种医疗病例的最先进的法学士学位,跨多个专业和成像模式.
- 引入新的指标来量化LLM生成的解释的可靠性和临床依据.
主要方法:
- 开发了一个框架来评估四个LLM的30个医疗病例,跨越10个专业和5种成像模式.
- 案例包括诊断图像与正确答案和分心器,旨在探测推理漏洞.
- 引入的指标:幻觉率,推理得分,解剖学正确性和接地偏差得分.
主要成果:
- 一些LLM实现了中度的诊断准确性,但往往依赖于肤浅的模式或有缺陷的逻辑.
- 即使在正确的预测中也观察到高基准偏差得分,这表明答案和临床推理之间存在脱节.
- 弱或不正确的推理是评估模型中最常见的失败模式.
结论:
- 仅仅关注诊断准确性是不够的;评估LLM预测的"如何"和"为什么"是必不可少的.
- 开发的框架为LLM推理提供了关键的见解,促进了可解释性.
- 这项工作支持更安全,更可靠地将LLMs集成到生物医学诊断工作流中.


