聊天GPT-4o的原因有多好? 专家评估手术手术中的诊断和治疗性能
Léna G Dietrich1, Laura De Pellegrin1, Valeria Rinaldi1
1Department of Plastic and Hand Surgery, Inselspital University Hospital Bern, University of Bern, 3010 Bern, Switzerland.
Journal of clinical medicine
|November 27, 2025
概括
像ChatGPT-4o这样的大型语言模型在手术决策支持方面表现有前途,特别是在诸如手掌道综合症等标准化条件下. 然而,它们在复杂的病例中表现出局限性,这强调了需要专家外科监督的需要.
科学领域:
- 人工智能在医学中的应用
- 手术决策支持系统 手术决策支持系统
- 手和周围神经手术手术
背景情况:
- 大型语言模型 (LLM) 在手术决策中的作用正在扩大,但它们在手和外围神经手术中的实用性尚未得到充分探索.
- 本研究研究了ChatGPT-4o在复杂的手术场景中的诊断和治疗能力,这些场景具有多种有效的治疗选择,并且没有专家共识.
研究的目的:
- 为了评估ChatGPT-4o在手术病例场景中的诊断准确性,临床相关性和完整性.
- 评估ChatGPT-4o在具有竞争性管理策略的条件下,如CMC I关节炎,骨非结合症和手足道综合征的表现.
主要方法:
- 三个不同的手术病例 (CMC I关节炎,脚非结合,CTS) 通过标准化提示提示向ChatGPT-4o提交.
- 52名参与者 (34名手术医生,18名住院医生) 对诊断准确性,临床相关性和完整性进行了评估.
- 分析了可读性指数,包括弗莱什-金凯德等级水平.
主要成果:
- 聊天GPT-4o取得了中等的性能:诊断准确性 (2.9/5.0),临床相关性 (3.5/5.0),以及完整性 (3.4/5.0).
- 在标准化场景 (CTS) 中的表现优于与个性化推理 (CMC I关节炎) 相比.
- 可读性分析表明专业水平的语言 (弗莱什-金凯德分级:16.4).
结论:
- 聊天GPT-4o展示了作为手术教育和诊断支持工具的潜力,特别是在明确的条件下.
- 复杂或模两可的病例的局限性需要专家外科医生的持续监督.
- 未来的LLM开发应该专注于专业特定的培训和背景意识的推理,以加强外科决策支持.


