双子AI与ChatGPT:与眼科医生在医疗知识方面的综合检查
Daniel Bahir1,2, Omri Zur3, Leah Attal3
1Department of Ophthalmology, Tzafon Medical Center, Poriya, Israel. bahirdaniel@gmail.com.
概括
双子座高级在眼科委员会考试数据集中实现了最高的准确性 (66%),超过了ChatGPT模型,并展示了AI在医学教育和临床支持方面不断增长的潜力.
科学领域:
- 人工智能在医学中的应用
- 眼科 眼科研究 眼科研究
- 医疗教育 技术 技术 医学教育
背景情况:
- 人工智能领域的快速发展,包括像ChatGPT和谷歌的Gemini AI这样的大型语言模型 (LLM),正在改变技术创新.
- 人工智能对提高医学教育和在眼科等专业领域提供临床支持具有重大前景.
- 在医疗环境中评估这些人工智能模型的功能和局限性对于负责任的整合至关重要.
研究的目的:
- 为了比较谷歌的双子AI和ChatGPT与眼科住院医生的表现.
- 通过从眼科委员会考试中获得的数据集来评估不同的AI模型的有效性.
- 在眼科中识别人工智能性能的特定领域变异.
主要方法:
- 在12个子专业的眼科委员会考试中,编制了600个眼科考试题的数据集.
- 在数据集上测试了四种人工智能模型 (ChatGPT-3.5,ChatGPT-4,Gemini,Gemini Advanced).
- 使用特定评估指标,对以色列眼科医生进行了比较分析.
主要成果:
- 双子星高级实现了最高的精度66%,其次是ChatGPT-4 (62%),双子星 (58%) 和ChatGPT-3.5 (46%).
- 对比分析提供了对人工智能模型相对于人类医学知识的表现的见解.
- 进一步的分析探讨了年度趋势,主题特定的变化,以及基于图像的问题对准确性的影响.
结论:
- 双子座先进显示出卓越的性能,表明眼科人工智能能力的显著进步.
- 该研究强调了人工智能作为医学教育和潜在的患者护理中宝贵的补充工具的演变作用.
- 观察到细微的AI能力和特定领域的变化,强调了未来改进和优化的领域.


