在使用先进的人工智能学习和分析方法的家庭医学委员会考试中评估ChatGPT-4:观察性研究
Anthony James Goodings1, Sten Kajitani1, Allison Chhor2
1School of Medicine, University College Cork, Cork, Ireland.
JMIR medical education
|October 8, 2024
概括
聊天GPT-4在家庭医学委员会考试中表现强,达到高准确率. 这种人工智能显示出医学教育和评估的潜力,未来还有进一步的进展.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 人工智能辅助评估
背景情况:
- 现有的人工智能 (AI) 模型在医学委员会考试中显示出局限性.
- 这项研究通过评估ChatGPT-4在通过美国家庭医学委员会 (ABFM) 认证考试方面的能力来弥补这一差距.
- 该研究重点关注ChatGPT-4的高级文档分析和信息合成功能.
研究的目的:
- 评估ChatGPT-4在家庭医学委员会考试中达到或超过合格门的成绩的能力.
- 评估人工智能的表现,当提供广泛的准备资源和复杂的数据分析时.
- 探索先进的人工智能模型在医学认证评估中的潜力.
主要方法:
- 聊天GPT-4被集成到一个专门的"AI家庭医学委员会考生"子环境中.
- 人工智能访问和分析了医学教科书和基于网络的资源.
- 在受控条件下,AI回答了300个ABFM类型的考试问题.
主要成果:
- 在300个实践问题上,ChatGPT-4的正确答案率为88.67% (自定义机器人) 和87.33% (普通版本).
- 统计分析 (麦克纳马测试,P=.45) 显示两种AI版本的准确性没有显著差异.
- 奇方位分析 (P=.32) 表明不同版本的错误模式没有显著差异,突出显示了AI的一致性.
结论:
- 当提供专门的准备和量身定制的环境时,ChatGPT-4展示了医学委员会考试的有希望的潜力.
- 人工智能的性能与通过ABFM认证考试所需的标准相当.
- 这项研究为将人工智能工具整合到医学教育和评估中开辟了道路,强调了需要专门培训的需要.


