从胸部计算机断层扫描报告中检测多种疾病的大型语言模型的性能分析:一项比较研究:实验研究
Peng Luo1,2,3, Chaofan Fan4, Anghua Li2
1Donghai County People's Hospital - Jiangnan University Smart Healthcare Joint Laboratory, Donghai County People's Hospital, Lianyungang, Jiangsu Province, 222000, China.
International journal of surgery (London, England)
|June 11, 2025
概括
大型语言模型 (LLM) 在解释胸部CT报告方面表现有前途,GPT-4在准确性方面表现出色. 微调和多选题显著提高了胸部疾病的LLM诊断性能.
科学领域:
- 放射学和人工智能的人工智能
- 医疗信息学 医疗信息学
- 计算病理学计算病理学
背景情况:
- 计算机断层扫描 (CT) 是诊断胸部疾病的黄金标准,但解释的准确性在很大程度上依赖于放射科医生的专业知识.
- 大型语言模型 (LLM) 为增强医学成像诊断能力提供了重要机会,特别是在放射学中.
- 这项研究调查了LLM在分析复杂的胸部CT报告中的有效性.
研究的目的:
- 在分析非结构化胸部CT报告时,评估领先的大型语言模型 (LLM) 的诊断性能.
- 确定不同问询方法 (多选项与开放式) 对LLM准确性的影响.
- 评估微调策略在提高胸部疾病LLM诊断精度方面的有效性.
主要方法:
- 对13489份胸部CT报告进行了回顾性分析,涵盖13种胸部疾病.
- 五个LLM (Claude-3.5-Sonnet,GPT-4,GPT-3.5-Turbo,Gemini-Pro,Qwen-Max) 用多选项和开放式问题进行了评估.
- 使用参考答案准确率 (RAAR) 和主观答案准确率 (SAAR) 测量模型性能; GPT-3.5-Turbo在200个情况下进行了微调.
主要成果:
- 在多选题中,GPT-4获得了最高的RAAR (75.1%),明显超过其他模型.
- 与开放式问题相比,多选题在所有评估的LLM中始终产生更高的准确性 (RAAR和SAAR).
- 微调显著改善了GPT-3.5-Turbo的性能,特别是对于最初被错误分类的胸部疾病.
结论:
- 一般目的的LLM可以有效地解释胸部CT报告,其性能取决于模型,询问方法和微调.
- 这些发现为选择人工智能工具提供了基于证据的见解,以加强胸部外科手术的术前规划.
- 在手术工作流程中优化LLM集成可以改善决策,风险分层和诊断速度,以获得更好的患者结果.


