大型语言模型在转移性前列腺癌中的临床实用性:为决策支持提供多中心专家验证
Yinsong Chen1, Kangwen He1, Weinuo Qu1
1Department of Radiology, Tongji Hospital, Tongji Medical College, Huazhong University of Science and Technology, Wuhan, Hubei, China.
概括
大型语言模型 (LLMs) 在协助转移性前列腺癌 (mPCa) 治疗规划方面表现有前途. 然而,目前的LLM在15-21%的案例中违反了安全值,限制了无监督使用.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 转移性前列腺癌 (mPCa) 的系统治疗规划需要整合复杂的临床和生物标志物数据.
- 大型语言模型 (LLM) 具有潜力,但它们在这个关键应用中的安全性和可靠性尚未得到证实.
研究的目的:
- 评估当代LLM在生成mPCa.的临床摘要和治疗建议方面的安全性和实用性.
- 在238个mPCa案例中评估五个LLM的表现,使用严格的多阶段评估协议.
主要方法:
- 一项多中心的回顾性研究评估了5个LLM在238个mPCa情况下使用零射击提示.
- 输出的安全性由多学科团队评估,而实用性 (准确性,指导方针一致性,定制性,理由) 由医疗瘤学家评估.
- 统计分析包括弗里德曼和科克兰对配对顺序和二进制结果的Q测试.
主要成果:
- LLM的安全率从79.0%到84.9%不等,故障集中在复杂的案件中.
- 安全通过的输出实现了中等的实用性得分 (利克特平均值为4),总结性能有所变化.
- 常见的错误包括数据提取问题,指南逻辑偏差和遗漏的安全检查.
结论:
- 目前的LLM可以作为mPCa护理的起草助理,提高效率.
- 大约15-21%的LLM输出未能通过安全评估,排除了初始治疗规划中的无监督临床使用.


