验证放射学人工智能模型在光子计数CT图像上的性能,使用大型语言模型进行基准真相提取
Yee Seng Ng1, Mohammed M Kanani2, William E King1
1Department of Radiology, University of Washington, Seattle, Washington.
Journal of the American College of Radiology : JACR
|November 20, 2025
概括
大型语言模型 (LLM) 自动从放射学报告中提取地面真相标签,使人工智能 (AI) 工具的可扩展评估成为可能. 这种方法可靠地验证AI性能,即使使用新的成像硬件,如光子计数CT扫描仪.
科学领域:
- 放射学 放射学是一门学科.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 放射性人工智能 (AI) 工具需要持续监测和验证.
- 手动从放射学报告中提取地面真相标签是耗时且资源密集的.
- 新的成像硬件,如光子计数CT (PCCT) 扫描仪,可以引入影响AI性能的输入漂移.
研究的目的:
- 评估使用大型语言模型 (LLM) 来自动从放射学报告中提取地面真实标签的可行性.
- 为了使放射性AI工具的可扩展评估和监测.
- 在新的PCCT扫描仪上验证AI模型的性能.
主要方法:
- 针对肺栓塞,内出血,椎骨折和脊椎压缩骨折的四种FDA批准的AI工具的回顾性分析.
- LLM (Llama 3.3) 用于从PCCT的放射学报告和传统扫描仪数据中提取二进制基准真实标签.
- 人工智能输出与LLM提取的标签的比较,与人类注释者裁决的不一致案件.
- 使用Fleiss的 κ测试测量Interrater可靠性;在LLM错误纠正后重新计算性能指标.
主要成果:
- 在所有四个诊断任务中,LLM提取的标签促进了快速AI性能评估.
- 在PCCT和非PCCT队列之间没有观察到统计学上显著的绩效差异.
- LLM标签与最终的人类注释有很强的一致性 (κ = 0.731),相当于读者之间的一致性 (κ = 0.720),证实了LLM标签的可靠性.
结论:
- 大型语言模型提供了一个可扩展和高效的自动化解决方案,用于从放射学报告中提取地面真实标签.
- 这种基于LLM的方法支持人工智能工具的快速本地验证,有效地应对新成像硬件和输入漂移带来的挑战.
更多相关视频
05:49Author Spotlight: Advancing CBCT and Digital Dental Image Integration with AI-Assisted Digitization
Published on: February 23, 2024
1.3K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
