大型语言模型在良性和恶性胆管狭窄的差异诊断中的性能
Chenxi Kang1, Jing Li1, Xintian Yang1
1Xijing Hospital of Digestive Diseases, Air Force Medical University, Xi'an, China.
Frontiers in oncology
|July 18, 2025
概括
大型语言模型 (LLM) 在诊断胆管狭窄方面表现有前途,一些模型与医生的准确性相匹配. 然而,与经验丰富的医生相比,LLM在诊断状狭窄方面表现不佳.
科学领域:
- 胃肠病学 胃肠病学
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 区分良性和恶性胆道狭窄是一个重要的临床挑战.
- 大型语言模型 (LLM) 提供了在复杂医疗病例中提高诊断准确性的潜力.
- 这项研究调查了LLM在胆道狭窄的差异诊断中的有效性.
研究的目的:
- 评估十个LLM在区分良性和恶性胆道狭窄的诊断性能.
- 将LLM的表现与已知方法比较,例如瘤标记物,临床模型和专家医生.
- 分析特定子组的LLM表现,例如hilar与non-hilar狭窄.
主要方法:
- 对159名经过ERCP的胆管收缩患者的回顾性分析.
- 标准化提示十个LLM与临床,实验室和成像数据.
- 与瘤标志物 (CA19-9,CEA),多变量临床模型和十名医生的性能比较.
主要成果:
- 四个LLM的准确度达到了80%以上,Kimi的准确率达到了87%,超过了70%的医生.
- 在诊断准确度方面,LLMs和临床模型超过了瘤标志物.
- 医生对状狭窄 (87%) 的准确性高于非状狭窄 (79%),而LLM的表现不同.
- 与超过一半的医生相比,LLM对状狭窄的准确性较差.
结论:
- 某些LLM可以达到与胆道狭窄的临床模型和医生相比或超过的诊断准确度.
- 在诊断状狭窄时,LLM的表现明显低于经验丰富的医生.
- 需要进一步的研究来完善LLM对复杂的解剖位置的能力,如状胆道狭窄.


