在腹腔镜胆囊切除术中,ChatGPT和其他大型语言模型:可靠性,质量和可读性的多维审计
Yusuf Yunus Korkmaz1, Oğuzhan Aydın2, Feyyaz Güngör2
1Department of General Surgery, Başakşehir Çam and Sakura City Hospital, Istanbul, Turkey. yusufyunuskorkmaz@gmail.com.
Surgical endoscopy
|October 24, 2025
概括
大型语言模型 (LLM) 显示了用于指导腹腔镜胆囊切除术 (LC) 的可变可靠性. 术语丰富,而不是复杂性,影响了LLM的表现,需要在临床使用之前进行程序特定的验证.
科学领域:
- 人工智能在医学中的应用
- 手术技术 手术技术
- 临床决策支持系统 临床决策支持系统
背景情况:
- 将大型语言模型 (LLM) 整合到外科实践中,特别是对于像腹腔镜胆囊切除术 (LC) 这样的手术,需要对其可靠性的严格评估.
- 需要证据来评估当前LLM在整个外科手术工作流程中提供准确指导的有效性.
研究的目的:
- 为了比较五个领先的LLM在回答LC的指导方针衍生问题的表现.
- 评估LLM产生的外科指导的质量,可读性和可靠性.
主要方法:
- 一项分析横截面研究评估了五个LLM (ChatGPT-o3,Claude-Sonnet-4,DeepSeek-V3.5,Gemini-2.5 Flash,Grok-3) 使用24个指导方针衍生的问题对LC进行评估.
- 四名失明的外科医生使用修改的DISCERN (mDISCERN) 和全球质量评分 (GQS) 评估了120个答案. 此外,还分析了可读性和评审者之间的一致性.
主要成果:
- 格洛克-3显示了最高的质量评分 (mDISCERN: 36.3; GQS: 4.76),而双子座-2.5闪光灯得分最低.
- DeepSeek-V3.5提供了最易读的输出,而Claude-Sonnet-4产生了最难读的文本.
- 答案质量与词汇密度和单词数量正相关,而不是语法复杂性. 外科医生的评级显示出良好的可靠性 (ICC ≈ 0.77-0.82).
结论:
- 在指导LC方面,LLM的表现有很大的差异,没有一个模型可以实现完全的可靠性.
- 在临床实施之前,对LLM的程序特定验证至关重要.
- 这项研究为选择和完善外科LLM建立了基准,强调术语丰富性而不是句子复杂性,以提供高质量的指导.

