随着时间的推移,比较ChatGPT,DeepSeek和Gemini在系统和总体审查任务中的表现
Journal of the American Dental Association (1939)
|October 16, 2025
概括
大型语言模型 (LLM) 在系统性审查中显示出数据提取的前景,其中DeepSeek表现出色. 然而,LLM在全文选和偏见风险评估方面的表现仍然不可靠,需要专家监督.
科学领域:
- 医疗研究中的人工智能
- 卫生科学 信息学 信息学
- 计算生物学 计算生物学
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于系统和总体审查中的自动化任务.
- 这项研究比较了ChatGPT-4o,DeepSeek-V3和Gemini 1.5 Pro在关键审查任务中的性能.
研究的目的:
- 评估三个领先的LLM在全文选,数据提取和偏差风险评估方面的准确性.
- 在三个星期内,通过系统和总体审查类型来比较LLM的表现.
主要方法:
- 三个独立的账户促使LLM (ChatGPT-4o,DeepSeek-V3,Gemini 1.5 Pro) 在三周内对40个主要研究进行审查任务.
- 答案正确性得分,并使用肯德尔W,概括估计方程和曼-惠特尼U测试分析数据.
主要成果:
- DeepSeek-V3显示了最高的数据提取准确度 (>90%),其次是ChatGPT-4o (>88%).
- 在数据提取方面,DeepSeek-V3显著优于Gemini 1.5 Pro (P < .0167).
- 在为期三周的研究期间,Gemini 1.5 Pro显示了数据提取准确度的显著改善 (P < .0167).
结论:
- LLM显示出准确数据提取的潜力,DeepSeek-V3是首选的模型.
- 在全文选和偏见风险评估中LLM的表现不可靠,需要谨慎的专家监督.
- 研究人员应该意识到LLM的局限性,并在审查研究中明智地使用它们.

