在眼科中,ChatGPT o3-mini-high和DeepSeek-R1的比较性能:对诊断推理和基于案例的问题解决的评估
G Karataş1, F Kırık2, M E Karataş3
1Department of Ophthalmology, Prof. Dr. Cemil Taşcıoğlu City Hospital, Istanbul, Turkey.
Journal francais d'ophtalmologie
|December 11, 2025
概括
在诊断眼科病例方面,ChatGPT o3-mini-high显著超过了DeepSeek-R1,显示出更高的准确性和更好的推理能力. 这项研究强调了ChatGPT.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 大型语言模型 (LLM) 在医疗应用中表现有前途.
- 评估LLM诊断推理对于临床整合至关重要.
- 眼科提出了复杂的诊断挑战,适合人工智能评估.
研究的目的:
- 将ChatGPT o3-mini-high和DeepSeek-R1.1的诊断推理和问题解决方法进行比较.
- 评估基于文本的眼科病例的LLM绩效.
- 使用Elstein的框架评估LLM准确性和推理能力.
主要方法:
- 使用了来自9个子专业的55个基于文本的眼科病例.
- 评估了两个LLM,即ChatGPT o3-mini-high和DeepSeek-R1,进行了评估.
- 应用了埃尔斯坦的诊断推理方法和全球质量评分 (GQS).
- 专家眼科医生评价了LLM的推理能力.
主要成果:
- 聊天GPT o3-mini-high 实现了80%的准确性,而DeepSeek-R1 的准确性为54.5% (P<0.001).
- 聊天GPT o3-mini-high获得更高的GQS分数 (中位数为4.5与2.5,P<0.001).
- 这两种LLM在视网膜/玻璃体中表现最好,在青光眼病例中表现最差.
结论:
- 在眼科中,ChatGPT o3-mini-high 显示出卓越的诊断准确性.
- 这项研究证实了ChatGPT o3-mini-high的高级推理能力超过了DeepSeek-R1.1.
- 在复杂的眼科病例分析中,LLM显示出有潜力.


