评价大型语言模型在产生肺结节的后续推
Junzhe Wen1, Wanyue Huang1, Huzheng Yan2
1Department of Radiology, The Third Affiliated Hospital of Sun Yat-sen University, Guangzhou, China.
European journal of radiology open
|May 20, 2025
概括
大型语言模型 (LLM) 在生成肺结节后续推方面表现出强的表现,与专家放射科医生相比. 虽然对决策支持有希望,但严格的验证对于确保患者安全和减轻临床风险至关重要.
科学领域:
- 放射学中的人工智能
- 临床决策支持系统 临床决策支持系统
- 肺结节管理 肺结节管理
背景情况:
- 肺结节需要根据放射学发现和既定的指导方针准确的后续建议.
- 大型语言模型 (LLM) 提供了自动化和标准化临床建议的潜力.
研究的目的:
- 评估LLM (GPT-4o-mini,ERNIE-4.0-Turbo-8K) 在产生肺结节的后续建议方面的性能.
- 将人工智能生成的建议与放射科医生定义的,基于指南的标准进行比较.
主要方法:
- 对1009个CT肺结节的随访报告的回顾性分析.
- 运用了几次射击学习和思维链方法来实现快速工程.
- 评估了准确性,结节分类和有害性的LLM建议.
主要成果:
- GPT-4o-mini和ERNIE-4.0-Turbo-8K显示了可比的准确性 (92.8%与94.6%) 和低的有害性率 (3.5%与2.9%).
- 这两种模型在结节分类,敏感性和特异性方面都取得了很高的准确性.
- 人工智能建议与放射科医生定义的标准密切结合.
结论:
- LLM显示出在为肺结节提供基于指导方针的后续推方面的巨大潜力.
- 严格的验证和人类监督对于减轻与人工智能驱动推相关的临床风险至关重要.
- 这项研究强调了LLMs在自动化放射学决策支持方面的潜力.


