在外科手术中对GPT问答的分层评估揭示了人工智能 (AI) 知识差距
Rebecca Murphy Lonergan1, Jake Curry2, Kallpana Dhas1
1Department of Medical Education, Chelsea and Westminster Hospital NHS Foundation Trust, London, GBR.
Cureus
|December 15, 2023
概括
大型语言模型 (LLM) 对手术有希望,但性能因专业而异. 与一般医学相比,GPT-4在外科问题上的表现不佳,这表明需要有针对性的LLM改进.
科学领域:
- 人工智能在医学中的应用
- 在医疗保健中的自然语言处理.
- 外科信息学外科信息学
背景情况:
- 大型语言模型 (LLM) 在医学教育,患者放心和临床决策支持方面具有潜力.
- 了解专门在外科领域和跨专业的LLM绩效至关重要,但未被充分探索.
研究的目的:
- 评估LLMs在回答临床外科问题的表现.
- 评估不同外科专业的LLM的性能变化.
主要方法:
- 利用MedMCQA数据集,提取了23035个外科手术多选择题.
- 关于生成预训练变压器 (GPT) -3.5和GPT-4模型的提交问题.
- 计算和比较模型之间的问题答案准确性,以及跨手术学科的准确性.
主要成果:
- 在手术问题上,GPT-3.5的准确率达到53.3%,而GPT-4的准确率达到64.4% (统计学上有显著差异).
- 与MedMCQA数据集的整体表现相比,GPT-4在手术问题上的表现更差;GPT-3.5显示了相反的趋势.
- 准确性在各专业之间有很大的差异,在解剖学,血管和儿科手术方面表现更高,在骨科,耳鼻科医生和神经外科手术方面表现较低.
结论:
- LLM在解决外科手术问题方面表现出能力,但专业特定的性能变化是一个关键问题.
- 在手术问题上观察到的GPT-4性能下降凸显了专门微调和更新的必要性.
- 进一步的研究和持续的监测对于优化LLM在外科手术中的实用性和防止错误信息至关重要.


