在前列腺癌中评分医生风险沟通使用大型语言模型
Guillermo Lopez-Garcia1, Dongfang Xu1, Michael Luu2
1Department of Computational Biomedicine, Cedars-Sinai Medical Center, Los Angeles, CA, USA.
medRxiv : the preprint server for health sciences
|August 20, 2025
概括
这项研究引入了使用大型语言模型的AI框架,以自动评估前列腺癌护理中的医生风险沟通质量. 这种可扩展的解决方案改进了手动评估,增强了共享决策.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 有效的风险沟通对于前列腺癌治疗的共同决策至关重要.
- 目前对医生沟通质量的手动评估是耗时的,无法扩展.
- 沟通治疗权衡的变化会影响患者的理解和选择.
研究的目的:
- 开发和验证一个结构化,基于标签的框架,使用大型语言模型 (LLM) 来自动评分风险沟通质量.
- 评估LLM,特别是GPT-4o在评估前列腺癌咨询中医生沟通方面的表现.
- 建立一种可扩展的方法来分析瘤学中医生与患者的沟通.
主要方法:
- 开发了一个基于标签的框架,以在五个关键领域评分医生沟通:癌症预后,预期寿命和三种治疗副作用.
- 从20个临床访问成绩单中,医生发言的487个句子被用0-5分的分数标注,以获得准确性和患者特异性.
- 该任务以多类分类为模式,评估微调变压器和GPT-4o,使用基于标题和思维链 (CoT) 的提示,包括几次学习.
主要成果:
- 最高效的方法,结合了基于标记的CoT提示与几次射击的学习,在评估的领域实现了微平均F1分数在85.0%至92.0%之间.
- 这种人工智能驱动的方法超过了传统的监督基线模型.
- 开发的框架表现出与人类互注记者协议相当的性能.
结论:
- 大型语言模型,特别是基于标签的CoT提示和几次射击的学习的GPT-4o,为评估前列腺癌护理中的医生风险沟通提供了可扩展和准确的方法.
- 这种由人工智能驱动的方法为自动评估医生与患者之间的沟通提供了基础,有可能改善共享决策.
- 这些发现对质量改善举措和瘤学和其他医疗领域的培训有影响.


