修改和验证系统因果关系尺度使用人工智能为泌尿癌患者的治疗建议:开发前性比较研究的基础
Emily Rinderknecht1, Dominik von Winning2, Anton Kravchuk2
1Department of Urology, Caritas St. Josef Hospital, University of Regensburg,93053 Regensburg, Germany.
Current oncology (Toronto, Ont.)
|November 26, 2024
概括
人工智能,特别是大型语言模型 (LLM),在改善癌症治疗决策方面表现有前途. 这项研究验证了工具,并为一项试验选择了LLM,将AI与尿道癌症多学科瘤板进行比较.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医疗决策的制定 医疗决策的制定
背景情况:
- 大型语言模型 (LLM) 显示了增强瘤学治疗决策的潜力.
- 现有研究表明,LLM建议可以与多学科瘤委员会 (MTB) 相匹配,但尿道癌症的数据有限.
- 这项研究为CONCORDIA试验奠定了基础,这是一项针对泌尿癌的非劣势试验.
研究的目的:
- 验证系统因果关系量表 (SCS) 和其修改版 (mSCS) 用于评估治疗建议.
- 为泌尿癌治疗建议选择合适的LLM.
- 建立康科迪亚试验的方法先决条件.
主要方法:
- 使用40种泌尿癌情景验证了SCS和mSCS,并比较了LLM (ChatGPT-4) 和MTB建议.
- 利用两个德尔菲过程来选择LLMs (ChatGPT-4,克劳德3.5索内特) 并定义非劣势差额.
- 为CONCORDIA非劣等性试验建立的试验参数,包括样本大小和统计值.
主要成果:
- 无论是SCS还是mSCS都表现出强大的有效性,可靠性 (科恩的K>0.74),以及内部一致性 (克朗巴赫的阿尔法>0.9).
- 与SCS相比,mSCS表现出更高的可靠性,内部一致性和临床适用性 (p < 0.01).
- 根据专家的共识,在CONCORDIA试验中选择了ChatGPT-4和Claude 3.5 Sonnet作为LLMs.
结论:
- 这项准备性研究成功验证了mSCS,证明了其在评估治疗建议方面的高适用性和可靠性.
- 该研究为即将到来的CONCORDIA试验建立了必要的LLMs和方法框架.
- 这些发现支持使用验证的尺度和选择的LLM用于未来的研究,将人工智能驱动的建议与瘤学的传统多学科方法进行比较.


