儿童眼科医学的人工智能:对ChatGPT-4.0和DeepSeek-R1性能进行比较研究
Gamze Karataş1, Mehmet Egemen Karataş2
1Department of Ophthalmology, Prof. Dr. Cemil Taşcıoğlu City Hospital, Istanbul, Turkey.
Strabismus
|July 29, 2025
概括
在回答儿科眼科问题时,DeepSeek-R1表现出比ChatGPT-4.0更高的准确性. 这突显了先进的大型语言模型 (LLM) 在专业医疗领域的潜力.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地使用.
- 评估LLM在儿童眼科等专业医疗领域的表现至关重要.
研究的目的:
- 为了比较ChatGPT-4.0和DeepSeek-R1在回答儿科眼科问题的准确性.
- 评估这些LLM在儿科眼科医学的不同子专业的表现.
主要方法:
- 策划了一组44个多选题,涵盖儿科眼科子专业.
- 聊天GPT-4.0和DeepSeek-R1都用于回答选定的问题.
- 统计分析了每个LLM的答案的准确性.
主要成果:
- DeepSeek-R1的整体准确率为93%,而ChatGPT-4.0.0的整体准确率为82%.
- 在视方面,DeepSeek-R1的准确率为82%,而ChatGPT-4.0.0的准确率为70%.
- 对于其他子专业,DeepSeek-R1达到100%的准确性,而ChatGPT-4.0达到89%.
结论:
- 在回答儿科眼科问题方面,DeepSeek-R1显著超过了ChatGPT-4.0.
- 在医学子专业中,LLM的表现有所不同,这表明需要进一步改进.
- 优化LLM对于其在临床儿科眼科设置中的可靠应用至关重要.


