大型语言模型可以在系统性审查中取代人类吗? 评估GPT-4在查和从多种语言的同行评审和灰色文献中提取数据的有效性
Qusai Khraisha1,2, Sophie Put3, Johanna Kappenberg2
1Trinity Centre for Global Health, Trinity College Dublin, Dublin, Ireland.
Research synthesis methods
|March 14, 2024
概括
像GPT-4这样的大型语言模型 (LLM) 显示了自动化系统审查的潜力. 然而,目前的表现有所不同,只有在最佳条件下在特定的全文选任务中才能获得类似人类的结果.
科学领域:
- 图书统计学 图书统计学
- 研究中的人工智能.
- 信息科学 信息科学 信息科学
背景情况:
- 系统审查对于基于证据的实践至关重要,但耗时.
- 大型语言模型 (LLM) 为系统审查任务提供了潜在的自动化.
- 发电预训练变压器 (GPT) -4在系统性审查中的表现仍然没有得到评估.
研究的目的:
- 评估GPT-4在系统审查任务中的能力 (标题/摘要选,全文审查,数据提取).
- 用"人类脱离循环"方法将GPT-4性能与人类性能进行比较.
- 评估GPT-4在各种文学类型和语言中的表现.
主要方法:
- 一个预先注册的研究,采用"人类脱离循环"的方法.
- 评估GPT-4的标题/摘要选,全文审查和数据提取.
- 考虑数据集平衡和及时可靠性的性能分析.
主要成果:
- 在一些任务中,GPT-4的准确性与人类相美,但随机协议和数据集不平衡扭曲了最初的结果.
- 在调整这些因素后,性能得分下降,数据提取的表现中等.
- 选性能在平衡数据集中不存在,在不平衡数据集中中度;使用可靠提示的全文选达到类似人类的水平.
结论:
- 目前,在系统性审查中使用LLM时建议谨慎使用.
- 初步证据表明,在定义条件下,LLM可以在特定的审查任务中与人类的性能竞争.
- 需要进一步的研究来优化LLM在系统审查中的应用.
更多相关视频
08:36Author Spotlight: Evaluating the Adjuvant Efficacy and Safety of Angong Niuhuang Pill in Viral Encephalitis Treatment
Published on: April 19, 2024
508
06:05The Participant-Reported Implementation Update and Score PRIUS: A Novel Method for Capturing Implementation-Related Data Over Time
Published on: February 19, 2021
1.3K
