在眼科考试中Chatgpt的表现; 人与人工智能对比
Ali Safa Balci1,2, Zeliha Yazar3, Banu Turgut Ozturk4
1Department of Ophthalmology, Beyoglu Eye Training and Research Hospital, University of Health Sciences, 34420, Istanbul, Turkey. alisafabalci@gmail.com.
International ophthalmology
|November 6, 2024
概括
在眼科住院医生考试问题上,ChatGPT取得了53.6%的成功率,表现低于第三年住院医生的平均水平. 它的答案很难理解,随着问题难度的增加,准确性下降.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能在医学中的应用
- 医学教育 医学教育
背景情况:
- 像ChatGPT这样的人工智能 (AI) 工具的整合到医学教育中正在迅速发展.
- 在专业医疗检查中评估AI的性能对于了解其潜力和局限性至关重要.
研究的目的:
- 评估ChatGPT对眼科住院培训发展考试中的问题答案的准确性.
- 为了比较ChatGPT的表现与眼科住院医生在不同的资历水平.
主要方法:
- 聊天GPT提供了75个考试问题,涵盖9个部分和3个难度级别.
- 通过使用Flesch阅读易度 (FRE) 评分,分析了答案和解释的准确性和可读性.
- 居民的表现按年龄分类,并与ChatGPT的结果进行比较.
主要成果:
- 聊天GPT正确回答了53.62%的问题,在镜头和白内障方面取得了最高的成功 (77.77%),在儿科眼科医生和直视症 (0.00%) 中取得了最低的成功.
- 聊天GPT的整体准确率 (53.62%) 低于平均居民准确率 (50.37%),排名低于第三年居民.
- 随着问题难度的增加,准确性下降,ChatGPT答案的平均FRE得分很低 (27.56±12.40),表明可读性差.
结论:
- 聊天GPT在眼科住院生考试问题上表现中等,但与住院生相比表现不佳,特别是那些在更高年级的住院生.
- 聊天GPT解释的可读性是一个重大问题,阻碍了其在医学培训中的实用性.
- 未来的AI模型代可能会显示出更好的性能,因为它们包含了更多的医学知识.


