大型语言模型标准化了对大脑转移的复杂瘤学指南的解释
Berna Akkus Yildirim1, Baver Tutun2, Gorkem Durak3
1Department of Radiation Oncology, University of Health Science, Prof. Dr. Cemil Tascioglu City Hospital, Istanbul, Turkey. bernaakkus@yahoo.com.
Communications medicine
|December 15, 2025
概括
大型语言模型 (LLM) 在解释瘤学指南对大脑转移的建议方面明显优于医学专家,显示出更高的准确性和一致性. 这表明,LLM可以标准化指南解析,使专家能够专注于患者特定的护理.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 临床瘤学指南
背景情况:
- 解释复杂的临床瘤学指导方针,特别是大脑转移,给医学专家带来了挑战,可能会影响治疗的一致性.
- 大型语言模型 (LLM) 显示出决策支持的希望,但它们在这个领域的有效性需要进一步研究.
- 本研究比较了人类专家和LLM在解释指南建议中的准确性和一致性.
研究的目的:
- 评估医学专家与领先的LLM在解释推的强度和证据质量的准则中的准确性和趋同.
- 为了比较不同LLM和人类专家在理解复杂的临床指南方面的表现.
主要方法:
- 神经外科医生和放射瘤学家评估了与四个LLM (ChatGPT-4o,Gemini 2.0,Microsoft Copilot Pro,DeepSeek R1) 一起的指导方针建议.
- 评估的参数包括准确性,接近答案率和科恩加权的卡帕 (κ) 对于评审者之间的可靠性.
- 重点是从ASTRO和ASCO-SNO-ASTRO指南中解释建议的强度和证据的质量.
主要成果:
- 与专家相比,LLM,特别是Gemini和DeepSeek在解释ASTRO指南方面取得了显著更高的准确性 (高达100%) 和趋同性 (κ高达1.000). (最大58.82%的准确性, κ ≤0.504).
- 所有组都发现证据质量和ASCO指南更具挑战性,但LLM总体上保持了更好的趋同.
- 对于ASCO推的强度,DeepSeek显示了61.53%的准确性和k = 0.428,超过了专家的变量性能.
结论:
- 与人类专家相比,LLM在对临床指南分类的结构化解释方面表现出更高的准确性和趋同.
- 法律法规可以作为标准化指南解释的有效工具,从而优化专家对复杂临床推理的时间.
- 这有助于专家转向专注于患者特定因素的转变,如治疗决策中的背景,并发症和偏好等.


