在抽象和GPT模型之间对查性能进行比较研究:系统审查和上下文分析分析
Sheyang Xu1, Zhiheng Zhao1, Xingling Liu1
1Department of Orthopaedic Surgery, Beijing Anzhen Hospital, Capital Medical University, Beijing, 100013, China.
BMC medical informatics and decision making
|August 8, 2025
概括
在系统性审查的文献选中,GPT模型的表现优于Abstrackr,显示出更高的精度和特异性. 整合这两种工具可以优化未来的系统审查效率.
科学领域:
- 图书统计学 图书统计学
- 信息科学 信息科学 信息科学
- 研究中的人工智能.
背景情况:
- 系统审查和快速审查对于证据综合至关重要.
- 由于出版量不断增加,文学选是系统审查的一个主要挑战.
- 自动化工具旨在提高证据综合的效率.
研究的目的:
- 为了比较Abstrackr和生成预训练变压器 (GPT) 模型在系统审查的文献选中的性能.
- 通过使用关键性能指标,评估GPT-3.5和GPT-4与Abstrackr的有效性.
- 在证据综合中确定文学选的最佳策略.
主要方法:
- 采用了一种系统审查方法.
- 在PubMed,Cochrane图书馆和科学网上进行了搜索.
- 分析了包括回忆,精度,特异性和F1分数在内的性能指标.
主要成果:
- 与Abstrackr.相比,GPT模型显示出更高的精度 (0.51比0.21),特异性 (0.84比0.71),以及F1得分 (0.52比0.31).
- GPT模型显示了更高的整体效率和更好的选平衡.
- 在精细选过程中,GPT模型特别有效地减少了虚假阳性.
结论:
- 抽象适用于初始选阶段,而GPT模型在精细选方面表现出色.
- 结合Abstrackr和GPT模型的混合系统可以提高系统审查的效率和准确性.
- 未来的研究应该专注于为系统审查的不同阶段开发综合选工具.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
682
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
579
