在抽象选中评估大型语言模型的有效性:比较分析
Michael Li1, Jianping Sun2, Xianming Tan3,4
1Department of Biostatistics, University of North Carolina at Chapel Hill, Chapel Hill, NC, 27599, USA.
Systematic reviews
|August 21, 2024
概括
大型语言模型 (LLM) 在系统审查中显示出抽象选的高潜力,达到90%以上的准确性. 虽然不取代人类专家,但LLM提供了高效,具有成本效益的AI辅助工作流程,用于元分析.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 证据综合 证据综合
背景情况:
- 系统性审查和元分析对于基于证据的医学至关重要.
- 抽象选是系统审查中耗时的瓶.
- 评估这项任务的AI工具对于提高效率至关重要.
研究的目的:
- 评估各种大型语言模型 (LLM) 在系统审查的抽象选中的性能.
- 将LLM的有效性,效率和整合潜力与人类专家工作流程进行比较.
- 为了确定最有前途的LLMs自动化系统审查过程的部分.
主要方法:
- 开发了Python脚本以与LLM API进行接口 (例如,ChatGPT,Gemini,Llama,Claude).
- 在三个抽象数据库上评估了LLM的表现,使用灵敏度,特异性和准确度指标.
- 将LLM选结果与人为策划的包容性决定进行比较作为黄金标准.
主要成果:
- LLM的性能不同,ChatGPT v4.0达到90%以上的准确性.
- LLM 显示出高灵敏度和特异性,表明可靠的选能力.
- 法律法规提供了传统手动抽象选的经济有效和高效的替代方案.
结论:
- 在系统性审查中,LLM显示出对彻底改变抽象选的重大前景.
- 它们可以作为自主的人工智能审查员或增强人类专家工作流.
- 法律法规准备重新塑造系统审查和元分析过程,提高效率和潜在的准确性.


