生成型人工智能在第二年骨科住院医生水平上表现出色
Zachary C Lum1,2, Dylon P Collins3, Stanley Dennison3
1Orthopedic Surgery, University of California (UC) Davis School of Medicine, Sacramento, USA.
Cureus
|April 15, 2024
概括
谷歌BARD和ChatGPT在骨科手术中显示出潜力,BARD的整体表现优于ChatGPT. 虽然人工智能在回忆方面表现出色,但基于应用的知识和董事会认证需要进一步发展.
科学领域:
- 医疗教育中的人工智能
- 在手术中使用大型语言模型.
- 人工智能绩效评估评估的人工智能绩效评估
背景情况:
- 像ChatGPT和BARD这样的AI模型越来越多地用于信息处理.
- 评估人工智能能力对于防止医疗保健中的错误,偏见和错误信息至关重要.
- 整形外科手术需要严格的知识评估,使人工智能评估变得相关.
研究的目的:
- 评估ChatGPT和Google BARD在整形外科手术中的性能.
- 通过不同类型的问题和子专业来评估AI的表现.
- 将AI性能与骨科住院医生的检查结果进行比较.
主要方法:
- 对ChatGPT和BARD进行了757个骨科培训考试 (OITE) 问题.
- 排除了基于图像的问题,产生了390个多选题.
- 根据10个子专业和3个分类类别 (回忆,解释,应用) 分类问题.
- 统计分析了AI的表现,并将其与研究生年 (PGY) 的骨科住院数据进行了比较.
主要成果:
- 谷歌BARD的整体正确答案率 (58%) 比ChatGPT (54%) 高得多.
- 这两种AI在回忆问题上的表现都比基于应用的知识问题要好.
- 人工智能表现在PGY1的42至96百分位之间,在PGY5的1至17百分位之间,这表明与老年居民相比存在差距.
结论:
- 与ChatGPT相比,Google BARD在骨科手术知识方面表现优越.
- 人工智能工具显示出作为学习辅助工具的前景,特别是在骨科中基于回忆的知识.
- 目前的AI性能虽然与早期居民相比,但不符合董事会认证的标准.


