大型语言模型提供的甲状腺结节癌症风险评估和管理建议的适当性
1Radiological Sciences Department, College of Applied Medical Sciences, King Saud University, 11451, Riyadh, Saudi Arabia. mohalarifi@ksu.edu.sa.
Journal of imaging informatics in medicine
|March 3, 2025
概括
像ChatGPT,Gemini和Claude这样的大型语言模型 (LLMs) 显示出甲状腺结节癌风险评估的前景,与临床指南保持一致. 虽然性能类似,但ChatGPT和Claude的准确性和清晰度略高,这表明有潜在的监督临床支持.
科学领域:
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
- 瘤学的决策支持
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床应用.
- 在甲状腺结节癌风险评估中评估LLM建议的可靠性对于临床采用至关重要.
- 美国甲状腺协会 (ATA) 和国家综合癌症网络 (NCCN) 的当前临床指南为评估提供了一个基准.
研究的目的:
- 评估甲状腺结节癌风险评估建议的适当性和可靠性,来自ChatGPT,Gemini和Claude.
- 将这些LLM的性能与既定的临床指南 (ATA和NCCN) 进行比较.
- 评估AI产生的响应的可读性和定性反.
主要方法:
- 根据ATA和NCCN指南,制定24个临床相关问题.
- 使用可读性评分系统对AI响应可读性的评估.
- 322名放射科医生对人工智能产生的建议的评估,使用定量 (SPSS) 和定性 (Dedoose) 分析.
主要成果:
- 在ChatGPT,Gemini和Claude之间没有发现总体表现的统计学上显著差异.
- 克劳德 (21.84) 和ChatGPT (21.83) 的平均分数略高于双子座 (21.47).
- 在适当的反应中,ChatGPT显示了最高的准确性 (92.5%),其次是Claude (92.1%) 和Gemini (90.4%).
结论:
- LLM显示出支持甲状腺结节癌风险评估的潜力,但需要临床监督.
- 克劳德和ChatGPT表现相似,在得分和准确度方面差异很小.
- 需要进一步开发,以提高LLM可靠性,以便在瘤学中广泛临床使用.


