在放射学视觉语言模型中使用离散语义的幻觉过
Patrick Wienholt1,2, Sophie Caselitz3,4, Robert Siepmann3,4
1Lab for Artificial Intelligence in Medicine, Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen, Aachen, Germany. pwienholt@ukaachen.de.
European radiology
|February 20, 2026
概括
离散语义 (DSE) 能够有效地检测视觉语言模型 (VLMs) 容易产生幻觉的问题. 这种方法显著提高了放射图像分析的准确性,提高了临床应用的VLM可靠性.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 自然语言处理自然语言处理.
背景情况:
- 黑盒视觉语言模型 (VLMs) 越来越多地用于放射图像分析.
- 幻觉或不准确的信息生成对临床环境中的VLM可靠性构成重大挑战.
- 目前用于检测VLM幻觉的方法有限,特别是在黑子场景中.
研究的目的:
- 评估离散语义 (DSE) 在识别可能导致VLMs幻觉的问题时的有效性.
- 确定基于DSE的过是否可以提高基于放射图像的视觉问题答案 (VQA) 中的VLM的准确性.
主要方法:
- 一项回顾性研究利用了两个公共数据集 (VQA-Med 2019和诊断放射学数据集).
- GPT-4o和GPT-4.1模型回答了问题,从语义响应集群计算了DSE.
- 在过问题之前和之后评估了精度,DSE> 0.3.3.
主要成果:
- 对于GPT-4o的基线准确率为51.7%,对于GPT-4.1的基线准确率为54.8%.
- 在经过DSE过 (DSE>0.3) 后,准确性提高到GPT-4o的76.3%,GPT-4.1.1.的63.8%.
- 在数据集中,准确度的增长在统计学上是显著的,即使在进行了邦费罗尼校正之后.
结论:
- 通过量化语义不一致性,DSE可靠地检测黑盒VLM中的幻觉.
- 这种方法显著提高了放射性VQA的诊断答案准确性.
- DSE提供了一种实用的过策略,以提高临床VLM应用程序的安全性和可靠性.


