模仿游戏:大型语言模型与多学科瘤板相比:对21个瘤中心的AI进行基准测试
Cheng-Peng Li1,2, Aimé Terence Kalisa2, Siyer Roohani3,4,5
1Key Laboratory of Carcinogenesis and Translational Research (Ministry of Education/Beijing), Sarcoma Center, Peking University Cancer Hospital & Institute, Beijing, China.
Journal of cancer research and clinical oncology
|September 9, 2025
概括
大型语言模型 (LLM) 显示出有限的一致性和与专家肉瘤治疗建议的一致性. 虽然LLMs可能有助于为多学科瘤委员会讨论做准备,但专家咨询对于最佳的患者护理至关重要.
科学领域:
- 在瘤学瘤学.
- 人工智能在医学中的应用
- 医疗决策支持 医疗决策支持
背景情况:
- 软组织肉瘤 (STS) 管理需要复杂的决策.
- 多学科瘤委员会 (MTBs) 为STS治疗提供专家共识.
- 评估人工智能 (AI) 在增强临床决策中的实用性是一个新兴领域.
研究的目的:
- 将领先的大型语言模型 (LLM) 的治疗建议与复杂软组织肉瘤 (STS) 病例的人类专家多学科瘤委员会 (MTB) 的治疗建议进行比较.
- 评估LLM产生的治疗建议在瘤学的一致性,准确性和安全性.
主要方法:
- 使用四种先进的LLM (Llama 3.2-vision:90b,Claude 3.5 Sonnet,DeepSeek-R1,OpenAI-o1) 进行模拟的STS-MTB.
- 通过使用标准化提示,查询每个LLM21次,每个匿名的STS案件从肉瘤环试验.
- 将LLM的成果与人类MTB的一致性,对齐,替代建议和引用来源的建议进行比较.
主要成果:
- 在LLM中,模型间和模型内部的一致性很低 (20%),并且仅在20-60%的案例中与人类共识保持一致.
- 克劳德3.5奏显示出最高的一致性 (60%),但注意到了显著的差异和缺乏共同的建议.
- 在24.8-55.2%的回答中,LLM衍生的理由引用了德国S3肉瘤指南;观察到可能有害的建议.
结论:
- 目前的LLM在为复杂的STS病例提供可靠和安全的治疗建议方面存在重大局限性.
- 向大量的肉瘤中心转诊对于最佳的患者护理至关重要,尽管观察到人类专家建议的异质性.
- 法律法学显示出作为帮助准备多学科瘤委员会讨论的工具的潜力.
更多相关视频
07:15A Mouse Model of Incompletely Resected Soft Tissue Sarcoma for Testing Neoadjuvant Therapies
Published on: July 28, 2020
10.2K
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
495
