随着时间的推移,比较ChatGPT,DeepSeek和Gemini在系统和总体审查任务中的表现

概括

大型语言模型 (LLM) 在系统性审查中显示出数据提取的前景,其中DeepSeek表现出色. 然而,LLM在全文选和偏见风险评估方面的表现仍然不可靠,需要专家监督.