大型语言模型在手术自我评估考试中的比较性能
Clark J Chen1, Keenan Sobol1, Connor Hickey1
1Albert Einstein Healthcare Network, Philadelphia, PA, USA.
概括
Bing AI和ChatGPT 4.0在美国手术协会的自我评估考试中展示了作为学习工具的潜力,Bing AI获得了更高的分数.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
背景情况:
- 生成型人工智能 (AI) 模型在医学专业中显示出前景.
- 这项研究评估了AI在美国手术学会 (ASSH) 自我评估考试 (SAE) 的表现.
研究的目的:
- 评估ChatGPT 4.0和Bing AI在ASSH SAE上的表现.
- 确定生成性AI作为手术教育工具的有效性.
主要方法:
- 聊天GPT 4.0和Bing AI在ASSH SAE (2019-2023) 的999个多选题上进行了测试.
- 问题包括图像和视频组件;人工智能模型利用网络浏览和图像解释.
- 使用了ChatGPT 4.0和Bing AI (2023年5月) 的标准化版本.
主要成果:
- 聊天GPT 4.0的平均得分为66.5%,Bing AI的平均得分为75.3%.
- Bing AI的表现比ChatGPT 4.0高出8.8%,两者都超过了50%的合格门.
- 两种AI模型都在以图像和视频为基础的问题上扎.
结论:
- 像ChatGPT 4.0和Bing AI这样的生成性AI模型可以在ASSH SAE上获得通过分数.
- 这些人工智能工具有潜力作为交互式学习辅助工具,由于逻辑响应和引用的来源.


