在系统性审查的全文选中评估定制GPT的性能
Rachel C Davis1, Saskia S List1, Kendal G Chappell1
1Department of Community Medicine and Global Health, University of Oslo, Oslo, Norway.
Scandinavian journal of public health
|March 13, 2026
概括
一个叫做定制生成预训练变压器 (cGPT) 的AI工具在系统性审查中被评估为全文选. 助理cGPT显示出加速审查的希望,尽管需要进一步的研究来实现标准化.
科学领域:
- 研究中的人工智能.
- 系统审查方法论 系统审查方法论
背景情况:
- 系统性审查对于基于证据的实践至关重要,但需要大量的劳动力.
- 目前的AI工具主要协助标题/摘要选,在全文选支持中留下了一个空白.
研究的目的:
- 评估定制生成预训练变压器 (cGPT) 的性能,以便在系统审查中进行全文选.
- 为了比较cGPT作为自主审核员与助理审核员的有效性.
主要方法:
- 一个由ChatGPT4o支持的cGPT模型在文章子集上进行了测试.
- 人类审稿人评估文章的重复复制.
- 分析了模拟自主和助理角色的cGPT输出.
- 科恩的卡帕统计测量了评价者之间的一致性.
主要成果:
- 人与人之间的一致性kappa评分包括/排除范围从0.87到0.96.
- 自主cGPT-人类协议kappa得分范围从0.59到0.67.
- 助理cGPT-人类协议kappa分数在0.62到0.72.7之间.
- 对于排斥理由分类也观察到类似的趋势.
结论:
- 与自主cGPT相比,助手cGPT表现出更高的性能.
- 一个助理cGPT显示了提高系统审查效率的潜力.
- 需要进一步的研究,以建立可靠实施的标准化值.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.8K
09:35A Protocol for Using Gene Set Enrichment Analysis to Identify the Appropriate Animal Model for Translational Research
Published on: August 16, 2017
18.4K
