微软Bing在安特卫普大学的多项选择医学执照考试中超过了其他五个生成人工智能聊天机器人
Stefan Morreel1, Veronique Verhoeven1, Danny Mathysen1,2
1Department of Family Medicine and Population Health, University of Antwerp, Antwerp, Belgium.
PLOS digital health
|February 14, 2024
概括
大型语言模型聊天机器人对医学教育有前途,比如Bing和GPT-4等表现最好的机器人在许可证考试中超过了学生的成绩. 这些人工智能工具还可以识别考试的弱点并提高问题的质量.
科学领域:
- 医疗教育中的人工智能
- 自然语言处理应用程序
- 医疗保健专业培训 医疗保健专业培训
背景情况:
- 大型语言模型 (LLM) 和聊天机器人为医学教育提供了潜在的好处.
- 在医疗评估中,免费使用的聊天机器人的熟练程度仍未得到充分评估.
- 这项研究解决了在医疗环境中对领先的聊天机器人进行性能评估的需求.
研究的目的:
- 为了评估六种广泛使用的大型语言模型聊天机器人在医学许可证考试中的表现.
- 基于问题的难度,类型和语法结构来分析聊天机器人的表现.
- 在聊天机器人响应中识别推理错误和幻觉.
主要方法:
- 六个聊天机器人 (ChatGPT,Bard,New Bing,Claude Instant,Claude+,GPT-4) 在多项选择医学许可证考试中进行了测试.
- 绩效以正确答案的比例来衡量.
- 二次分析包括问题难度,问题类型 (临床细节与理论) 和错误分析 (幻觉,推理错误).
主要成果:
- 所有测试的聊天机器人都通过了医疗许可证考试.
- 新的Bing和GPT-4获得了最高的分数 (76%正确),超过了其他机器人和人类学生 (61%).
- 聊天机器人在难题上表现比学生更好,尽管在难题上表现普遍下降 (62%).
- 与Bard (22%) 和Claude Instant (19%) 相比,新Bing和GPT-4 (7%) 的幻觉率明显较低.
- 新的Bing发现了模两可的考试问题,没有聊天机器人拒绝回答临床病例问题.
结论:
- 大型语言模型聊天机器人显示出作为提高医疗教育和评估的工具的巨大潜力.
- 新的Bing和GPT-4表现出卓越的性能和较低的幻觉率,表明它们的高级能力.
- 聊天机器人可以作为教育工作者在提高多选择题考试的质量和效率方面提供有价值的帮助.


