从口述到诊断:通过多式联络大型语言模型的集成语音识别来增强放射学报告
Roman Johannes Gertz1, Nedim Christoph Beste2, Thomas Dratsch1
1Institute for Diagnostic and Interventional Radiology, Faculty of Medicine and University Hospital Cologne, University of Cologne, Cologne, Germany.
European radiology
|August 15, 2025
概括
音频多模式大语言模型 (LLM) 显著提高了放射学报告的效率并降低了成本. 这些先进的AI工具从最小的音频输入生成高质量的报告,优于传统的语音识别方法.
科学领域:
- 放射学中的人工智能
- 用于医疗文件的自然语言处理.
- 医疗信息学 医疗信息学
背景情况:
- 传统的放射学报告依赖于语音识别软件,这可能耗时且容易出现错误.
- 集成先进的人工智能,特别是多式联络大型语言模型 (LLM),为医疗报告的提高效率和准确性提供了潜力.
研究的目的:
- 与传统语音识别软件相比,使用音频多模式LLM评估放射学报告的效率,准确性和成本效益.
- 测试假设,多式联络LLM的最小音频输入可以生成完整的放射性报告.
主要方法:
- 一项比较性研究涉及80项研究的480个回顾性多式联络成像报告.
- 使用了两个报告工作流程:使用语音识别的传统工作流程 (C-WF) 和使用GPT-4o和Claude Sonnet 3.5.5的LLM-WF.
- 关键的结果指标包括报告时间,纠正次数和每份报告的人员成本,其正式结构和质量由放射科医生评估.
主要成果:
- 与C-WF (88.0s ± 60.9s) 相比,LLM-WF显著减少了报告时间 (38.9s ± 22.7s) (p<0.01).
- LLM-WF需要更少的校正 (GPT-4o: 1.0 ± 1.1,索内特3.5: 0.9 ± 1.0) 与C-WF (2.4 ± 2.5) 相比 (p<0.01).
- 与C-WF ($3.0 ± $2.1) (p<0.01) 相比,LLM-WF (GPT-4o: $2.3 ± $1.4,Sonnet 3.5: $2.4 ± $1.4) 的成本降低了;Sonnet 3.5报告在质量方面被评为最高.
结论:
- 多模式LLM可以从最小的音频输入生成高质量的放射学报告,表现出优越的速度,更少的错误和比传统方法更低的成本.
- 虽然有前途,但潜在的许可费用和更广泛的临床通用性需要进一步调查,以便广泛实施.


