大型语言模型和专家多学科团队在结直肠癌中的决策的比较
Boyang Qu1, Longhao Cao2,3, Chen Wu4
1State Key Laboratory of Holistic Integrative Management of Gastrointestinal Cancers, Beijing Key Laboratory of Carcinogenesis and Translational Research, Unit III (Colorectal & Ostomy Service), Gastrointestinal Cancer Center, Peking University Cancer Hospital & Institute, Beijing, China.
BMJ health & care informatics
|March 10, 2026
概括
大型语言模型 (LLM) 可以部分模拟结直肠癌的多学科团队 (MDT) 决策,显示与专家建议的公平一致. 它们的使用应该增强,而不是取代人类的临床判断.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 结肠直肠癌治疗计划是复杂的,通常需要多学科团队 (MDT) 的投入.
- 大型语言模型 (LLM) 提供了模拟复杂决策过程的潜力.
研究的目的:
- 评估LLM在复制结直肠癌MDT决策方面的能力.
- 评估人工智能产生的建议与专家MDT共识之间的一致性.
主要方法:
- 从MDT会议中对1423例结直肠癌病例进行了回顾性分析.
- 测试三个LLM (OpenAI o3-mini-2025-01-31,DeepSeek-R1 671b,Qwen qwq-plus-2025-03-05) 进行决策复制. 这是一个非常好的方法.
- 使用协议百分比和科恩的卡帕来评估一致性.
主要成果:
- 一个LLM (o3) 显示出高的模型内部稳定性 (81.0%一致).
- 与专家MDT共识的一致性在模型中从62.5%到65.4%不等.
- 治疗前的非转移性结肠癌病例显示出更高的一致性.
结论:
- 在结直肠癌中,LLM证明与MDT专家的决定达成公平一致.
- 在标准化,不那么复杂的案例中,性能更强.
- 在临床工作流程中,LLM的整合应该补充,而不是取代人类的专业知识.
关键词:
结肠直肠瘤是什么意思

