相关实验视频
Updated: May 24, 2025

06:48
Emergency Undocking in Robotic Surgery: A Simulation Curriculum
Published on: May 20, 2018
9.2K
解决复杂的儿科外科病例研究:对辅助飞行员,ChatGPT-4和经验丰富的儿科外科医生的表现进行比较分析
Richard Gnatzy1, Martin Lacher1, Michael Berger2
1Department of Pediatric Surgery, Leipzig University, Leipzig, Germany.
概括
像ChatGPT-4和Copilot这样的大型语言模型 (LLM) 在儿科手术诊断和临床问题上显示出有限的准确性. 虽然人工智能有潜力,但人类外科医生仍然超过了这些先进的模型.
科学领域:
- 医疗人工智能 医疗人工智能
- 儿科外科诊断 儿科外科诊断
- 临床决策支持系统 临床决策支持系统
背景情况:
- 大型语言模型 (LLM) 在包括医学在内的各个领域都在迅速发展.
- 在儿科手术中LLM的应用和有效性尚未得到充分证实.
- 在复杂的儿科外科病例中评估AI能力对于未来的整合至关重要.
研究的目的:
- 评估ChatGPT-4和微软Copilot在儿科手术中的诊断和临床问答能力.
- 将这些人工智能 (AI) 模型的性能与经验丰富的儿科外科医生进行比较.
- 评估AI产生的诊断建议的完整性和准确性.
主要方法:
- 利用了13个经典儿科手术疾病的复杂临床病例.
- 将AI模型 (ChatGPT-4,Copilot) 的反应与一组儿科外科医生的反应进行了比较.
- 儿科外科医生对人工智能诊断建议进行了评价;统计分析确定了性能差异.
主要成果:
- 儿科外科医生获得了最高的绩效评分 (68.8%),其次是ChatGPT-4 (52.1%) 和Copilot (47.9%).
- 在人工智能模型和人类外科医生之间观察到统计学上显著的性能差异 (p < 0.01).
- 与Copilot相比,ChatGPT-4显示出优异的差异诊断生成 (p <0.05);AI建议被评为平均值.
结论:
- 目前的人工智能模型在儿科外科临床决策的准确性和可靠性方面存在重大局限性.
- 虽然LLM很有前途,但他们的现有能力与在这个专业领域经验丰富的人类外科医生不匹配.
- 进一步的研究和开发是必要的,以提高AI的性能,并验证其在儿科手术中的临床实用性.

