在检测中国超声波时使用大型语言模型报告错误
Yuqi Yan1,2,3,4,5,6, Kai Wang7, Bojian Feng1,2,3,5
1Department of Diagnostic Ultrasound Imaging & Interventional Therapy, Zhejiang Cancer Hospital, Hangzhou, Zhejiang, China.
NPJ digital medicine
|January 28, 2025
概括
大型语言模型 (LLM) 在提高中文超声波报告准确性方面表现有前途. 与人类放射科医生相比,克劳德3.5索内特和GPT-4o表现出卓越的错误检测和更快的处理时间.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 放射学报告 放射学报告
背景情况:
- 超声报告对于诊断至关重要,但容易出现错误.
- 确保医疗报告的准确性对于患者护理至关重要.
- 大型语言模型 (LLM) 为自动化文本分析提供了潜力.
研究的目的:
- 评估LLM在提高中国超声报告准确性的有效性.
- 为了比较不同LLM与人类放射科医生在错误检测中的性能.
- 评估基于LLM的错误检测速度.
主要方法:
- 来自三家医院的400份中国超声波报告的回顾性分析 (2024年1月至4月).
- 在零拍摄和少数拍摄设置中评估GPT版本和克劳德3.5索内特.
- 与六位不同经验水平的放射科医生对错误检测的比较.
主要成果:
- 克劳德 3.5 索内特 (52.3%) 和GPT-4o (41.2%) 在零射击中显示出最高的错误检测率.
- 克劳德3.5 索内特在几次射击错误检测方面表现优于放射科医生.
- 实际上,LLM比人类放射科医生处理报告的速度要快得多.
结论:
- 在中国,LLM显示出显著的潜力,可以提高超声报告的准确性.
- 像Claude 3.5 Sonnet这样的特定LLM在某些错误检测任务中可以超过人类专家.
- 在超声波报告质量保证方面,LLM提供了更快,更准确的解决方案.


