在眼科中评估ChatGPT-4 Plus:图像识别和特定领域培训对诊断性能的影响
Kevin Y Wu1, Shu Yu Qian2, Michael Marchand1
1Department of Surgery, Division of Ophthalmology, University of Sherbrooke, Sherbrooke, QC J1G 2E8, Canada.
Diagnostics (Basel, Switzerland)
|July 29, 2025
概括
聊天GPT-4在眼科自我评估方面表现出强的表现,达到78%的准确性. 特定领域的培训将准确度提高到85%,这表明AI.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 人工智能的快速发展,包括ChatGPT,正在影响眼科等医疗领域.
- 评估AI在医疗应用中的潜力和局限性至关重要.
研究的目的:
- 评估ChatGPT-4在美国眼科院 (AAO) 基础和临床科学课程 (BCSC) 自我评估计划中的表现.
- 评估ChatGPT-4的图像识别能力和特定领域预训练的影响.
主要方法:
- 聊天GPT-4在1300个BCSC自我评估计划问题 (基于文本和图像) 上进行了测试.
- 应用了特定领域的预训练来评估性能提升.
- 准确度是主要结果,使用后勤回归和后期测试进行分析.
主要成果:
- 聊天GPT-4的平均准确率为78%,超过了测试者平均得分的74%.
- 特定领域的预训练将整体准确度提高到85%.
- 问题难度对准确度的影响最大,其次是图像存在和考试部分.
结论:
- 在眼科评估,包括基于图像的问题上,ChatGPT-4的表现与人类学员相比或优于人类学员.
- 特定领域的培训显著提高了AI模型的准确性.
- 人工智能工具在眼科中显示出潜在的教育价值,需要进一步调查.


