对大型语言模型 (ChatGPT) 在系统性审查数据提取中的性能进行批判性评估:探索性研究.
Hesam Mahmoudi1, Doris Chang1, Hannah Lee1
1MGH Institute for Technology Assessment, Harvard Medical School, 125 Nashua St, Boston, MA, 02114, United States, 1 6177243738.
JMIR AI
|September 11, 2025
概括
大型语言模型 (LLM) 显示出在系统文献评论 (SLR) 中自动化数据提取的前景. 虽然对明确数据有效,但LLM需要人类监督细微信息,通过精细提示提高准确性.
科学领域:
- 卫生和生物医学科学 医学
- 计算语言学计算语言学
- 研究方法研究方法论.
背景情况:
- 系统性文献审查 (SLR) 对于健康科学中的证据综合至关重要,但由于手动数据提取,它们需要大量的劳动力.
- 大型语言模型 (LLM) 提供了自动化研究任务的潜力,包括从学术论文中提取数据.
- 了解LLM在提取显式数据方面的能力对于推进SLR方法至关重要.
研究的目的:
- 评估ChatGPT (GPT-4) 在从学术文献中提取明确的研究特征和复杂的上下文信息方面的有效性.
- 评估快速改进对SLR数据提取中的LLM精度的影响.
主要方法:
- 对COVID-19建模研究的全文选.
- 提取明确的研究环境 (分析位置,建模方法,干预措施) 和复杂的行为组件 (流动性,风险感知,合规性).
- 两位研究人员手动提取数据的比较,与7次提示代的ChatGPT响应进行比较.
主要成果:
- 随着快速改进,ChatGPT的准确性得到了显著改善,从43.3%增加到71.7%的正确数据元素.
- 在提取明确的研究设置 (93.3%) 与主观行为组件 (50%) 相比,获得了更高的准确性.
- 性能在各个指标上有所不同,表明处理细微数据的局限性.
结论:
- 在提供有效提示时,LLM可以通过高效地提取基本的,明确的数据来增强SLR.
- 在微妙和主观数据的LLM性能存在显著的局限性,需要人类监督.
- 优化提示是最大限度地提高LLM在系统文献评论中的实用性的关键.

