大型语言模型在MRCS Part A中的表现:医学教育的工具?
Annals of the Royal College of Surgeons of England
|December 1, 2023
概括
像ChatGPT这样的大型语言模型 (LLM) 在MRCS Part A考试中展示了通过准确性,提供了有洞察力的答案. 然而,由于临床推理中的潜在不准确性,建议谨慎使用.
科学领域:
- 医疗教育中的人工智能
- 手术科学评估的评估.
- 自然语言处理应用程序
背景情况:
- 在MRCS Part A考试中,通过300个单一最佳答案多选题来评估外科科学.
- 大型语言模型 (LLM) 越来越多地用于医疗保健和医学教育.
- 法律法学证明了自然语言生成和信息合成的潜力.
研究的目的:
- 评估两个领先的LLM,ChatGPT和Bard在MRCS Part A考试问题上的表现.
- 在高风险的外科知识评估背景下评估LLM准确性,响应一致性和洞察力.
- 探索LLMs在支持外科教育和评估方面的潜力和局限性.
主要方法:
- 两个LLM (ChatGPT和Bard) 被测试,使用来自MRCS部分A问题库的300个问题.
- 提出了带有和没有理由要求 (NJ/J) 的问题.
- 根据准确性,一致性和提供有洞察力的陈述来评分LLM输出.
主要成果:
- 聊天GPT实现了85.7% (NJ) 和84.3% (J) 的精度,超过了MRCS A部分的通过门.
- 巴德实现了64% (NJ) 和64.3% (J) 的精度.
- 这两种LLM都表现出很高的一致性 (ChatGPT: 95.3% NJ, 93.7% J; Bard: 81.7% NJ, 79.7% J) 并在超过98% (ChatGPT) 和86% (Bard) 的输出中提供了洞察力.
结论:
- 聊天GPT符合MRCS Part A的合格准确性标准,两种LLM都显示出高度一致性和洞察力.
- 确定的局限性包括潜在的临床不准确性,对复杂情景的不完全理解以及过时的信息.
- 在医学教育中,LLM提供了可访问的,时间效率高的工具,可以将重点从常规记忆转移到更高级别的临床推理.


