测试GPT对标题和摘要选在环境系统证据综合中的有用性
Björn Nykvist1,2, Biljana Macura3, Maria Xylia3,4
1Stockholm Environment Institute, 115 23, Stockholm, Sweden. bjorn.nykvist@sei.org.
Environmental evidence
|April 24, 2025
概括
像GPT这样的大型语言模型 (LLM) 在选科学文章进行文献评论方面表现出高准确性. 使用GPT-4进行资格选可以显著减少手动选时间,高达75%.
科学领域:
- 信息科学 信息科学 信息科学
- 计算机科学 计算机科学
- 图书统计学 图书统计学
背景情况:
- 系统的文献审查需要对众多科学文章进行严格的资格选.
- 手动选是耗时和资源密集的,影响研究项目的时间表.
- 大型语言模型 (LLM) 提供了自动化复杂信息处理任务的潜力.
研究的目的:
- 评估OpenAI的大型语言模型 (LLM) GPT在科学文章的标题和摘要资格选方面的表现.
- 评估在系统文献审查工作流程中使用LLM的潜在时间节省和准确性.
主要方法:
- 在对电动汽车充电基础设施需求系统审查 (近12,000条记录) 的选数据上测试了GPT模型.
- 模型的任务是使用概率得分 (0-1) 来区分相关内容和无关内容.
- 与人类选器相比,使用回忆率和潜在的时间节省来评估性能.
主要成果:
- 在0.5的概率截止值下,GPT-4实现了100%的回忆,识别了所有相关论文,节省了50%的选时间.
- 凭借更高的值 (回忆率>95%),GPT-4可以节省高达75%的手动选时间.
- 在复制手动查时,LLMs的有效性,准确性和精确性表明了大量的工作和成本节约的潜力.
结论:
- 在科学文章资格选中,LLM,特别是GPT-4,表现出色.
- 使用LLM自动选为系统审查提供了大量的时间和成本效益.
- 需要进一步的研究和方法开发,才能充分评估LLMs对查的严谨性和有效性.


