评估GPT-4模型在多学科瘤委员会决策预测中的准确性
Efe Cem Erdat1,2, Merih Yalçıner3,4, Mehmet Berk Örüncü3,4
1Department of Medical Oncology, Ankara University Faculty of Medicine, Tip Fakultesi Cd. No 1 Mamak, Ankara, Turkey. cemerdat@gmail.com.
概括
像GPT-4这样的人工智能 (AI) 与癌症患者管理的多学科瘤委员会决策具有很高的兼容性. 虽然对临床瘤学支持有希望,但GPT-4在罕见或复杂的癌症病例方面存在局限性.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 人工智能 (AI) 模型,包括GPT-4,在瘤学中为临床决策提供了潜在的进步.
- 评估人工智能驱动的建议与既定临床实践的一致性对于安全的整合至关重要.
研究的目的:
- 评估多学科瘤委员会 (MTB) 决策与GPT-4预测在癌症患者管理中的一致性.
- 确定GPT-4作为瘤患者护理中的辅助工具的可靠性和适当性.
主要方法:
- 一项横截面研究分析了安卡拉大学医院MTB (2021年2月 - 2023年6月) 的610名癌症患者.
- 根据病例总结,GPT-4生成了治疗建议;三名评级人员使用4分利克特级别评估了相容性.
- 具有低兼容性评分的病例经过了专家瘤学家的适当性审查.
主要成果:
- 在GPT-4预测和MTB决策之间观察到高整体兼容性 (平均得分3.59/4),具有很好的评分间可靠性 (Cronbach的alpha=0.950).
- 10.2%的病例具有较低的兼容性评分,专家瘤学家在12.9%至25.8%的病例中发现GPT-4预测不合适.
- 差异主要源于罕见的缺少指导数据或对患者陈述的误解的罕见病例;注意到中度一致 (科恩的卡帕=0.50).
结论:
- GPT-4显示出与MTB决策的显著兼容性,表明其作为临床瘤学中宝贵的支持工具的潜力.
- 局限性仍然存在,特别是在罕见或复杂的瘤病例中,需要仔细监督和验证.
- 需要进一步的研究来完善人工智能模型的性能,并在各种临床场景中应对特定的挑战.


