在放射学中评估视觉语言模型的临床信息框架报告生成:错误分类学和风险意识度量表
Hao Guan1,2, Peter C Hou1,2, Pengyu Hong3
1Brigham and Women's Hospital, Boston, MA.
AMIA ... Annual Symposium proceedings. AMIA Symposium
|February 23, 2026
概括
这项研究引入了一个新的框架来评估人工智能生成的放射学报告,重点关注临床风险. 它揭示了视觉语言模型 (VLM) 的常见错误,提高了医疗成像中的AI安全性.
科学领域:
- 医学成像人工智能 医学成像人工智能
- 自然语言处理自然语言处理.
- 临床信息学 临床信息学
背景情况:
- 视觉语言模型 (VLMs) 显示了自动放射学报告生成的前景.
- 目前在放射学中对VLM的评估指标不足,缺乏临床特异性.
- 现有的方法依赖于一般的NLP指标或广泛的临床分数,缺少关键的安全细微差别.
研究的目的:
- 为VLM生成的放射学报告开发一个临床信息的评估框架.
- 建立放射学特异性错误的分类法,并与之相关的临床风险水平.
- 引入一种新的风险意识指标来量化人工智能生成的报告的安全影响.
主要方法:
- 定义了12种类型的放射学错误分类,用医生指定的临床风险水平 (低,中,高) 进行注释.
- 在三个VLM (DeepSeek VL2,CXR-LLaVA,CheXagent) 上使用685个MIMIC-CXR案例进行了错误分析.
- 引入了临床风险加权错误分数用于文本生成 (CREST) 度量.
主要成果:
- 在评估的VLM中确定了关键漏洞和常见的错误模式.
- 揭示了与不同类型的AI生成报告错误相关的特定条件风险概况.
- 在测试模型中表现出性能和安全影响的显著差异.
结论:
- 拟议的框架为评估医疗报告生成模型提供了一个以安全为中心的基础.
- 研究结果为开发更可靠和临床安全的放射学AI工具提供了可操作的见解.
- 该CREST指标使VLM生成的报告中的安全风险能够进行定量评估.


