使用大型语言模型对近视相关问题的基准分析:ChatGPT-4o和deepseek的比较
Jinglei Yao1, Sun Chen Hsin2, Luxi Li1
1Department of Ophthalmology, Beijing Jingmei Group General Hospital, No.18, Heishandajie, Mentougou District, Beijing, 102300, China.
BMC ophthalmology
|November 11, 2025
概括
与ChatGPT-4o相比,DeepSeek在近视问题上的准确度更高. 虽然这两种AI模型都提供了有用的信息,但在为近视管理提供当前的局部治疗细节方面存在局限性.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 人工智能 (AI) 聊天机器人越来越多地用于健康信息.
- 在近视等专业医疗领域评估AI反应的准确性至关重要.
- 聊天GPT-4o和DeepSeek是具有潜在临床应用的突出的大型语言模型 (LLM).
研究的目的:
- 评估和比较ChatGPT-4o和DeepSeek对近视相关询问的回复的准确性和全面性.
- 确定这些人工智能模型在提供眼科信息方面的优缺点.
主要方法:
- 在六个临床领域向ChatGPT-4o和DeepSeek提出了30个不同的近视问题.
- 三名医疗专业人员独立评估了答案的准确性和全面性.
- 统计分析包括Fleiss' Kappa用于评价者之间的可靠性和Chi-square测试用于比较.
主要成果:
- 深度搜索取得的准确度比ChatGPT-4o高得多 (p < 0.0001).
- 这两种模型都在准确时显示出良好的全面性,但在特定的当前治疗信息 (例如,DIMS镜头) 中遇到了困难.
- 报告指出,评审者之间的可靠性较差 (DeepSeek: κ=0.106;ChatGPT-4o: κ=-0.0221) 和得分分布异常.
结论:
- 聊天GPT-4o和DeepSeek提供了有价值的近视信息,但需要对特定区域的治疗进行更新.
- DeepSeek的表现表明,本地化的LLM可能在特定的医疗领域表现出色.
- 持续的AI模型改进,数据更新和微调对于可靠的临床通信至关重要.
关键词:
聊天GPT-4o的时间聊天机器人 聊天机器人在DeepSeek搜索中深入搜索.大型语言模型.近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近视近更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
04:48Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
3.3K
