在系统性审查和元分析中使用GPT-3.5轮模型进行标题和摘要选的敏感性和特异性
Viet-Thi Tran1, Gerald Gartlehner2, Sally Yaacoub3
1Université Paris Cité and Université Sorbonne Paris Nord, Inserm, INRAe, Centre for Research in Epidemiology and Statistics (CRESS), Paris; and Centre d'Epidémiologie Clinique, Hôpital Hôtel-Dieu, AP-HP, Paris, France (V.-T.T.).
Annals of internal medicine
|May 20, 2024
概括
GPT-3.5 Turbo显示了系统审查选的潜力,作为具有高灵敏度但也具有错误阳性的第二个审查员. 它可以减少手工选工作量,尽管在全文阶段可能会错过一些文章.
科学领域:
- 医疗研究中的人工智能
- 信息科学 信息科学 信息科学
- 图书统计学 图书统计学
背景情况:
- 系统审查对于基于证据的实践至关重要,但需要大量的劳动力.
- 科学文献的指数增长挑战了手动审查过程.
- 系统审查的部分自动化可以提高效率.
研究的目的:
- 评估GPT-3.5 Turbo作为一个单一的审查员在系统审查中进行标题和摘要选的准确性.
- 为了确定GPT-3.5 Turbo对此任务的灵敏度和特异性.
- 评估其在简化系统审查过程中的潜力.
主要方法:
- 采用了诊断测试准确性研究设计.
- 使用通用提示框架进行了GPT-3.5 Turbo的指令.
- 模型输出与人类审查员的决定在两个规则下进行了比较:平衡的灵敏度/特异性和优化灵敏度.
- 分析了来自5个系统评论的数据,包括22,665个引用.
主要成果:
- 在均衡规则下,GPT-3.5 Turbo实现了从81.1%到96.5%的灵敏度和从25.8%到80.4%的特异性.
- 在敏感规则下,敏感度在94.6%至99.8%之间,特异性在2.2%至46.6%之间.
- 在平衡规则下,GPT-3.5 Turbo识别了人类遗漏的引用的1%,但产生了高错误阳性率 (45.3%).
结论:
- GPT-3.5 Turbo可以在系统审查选中充当第二审核员,帮助识别错过的研究.
- 它的使用需要管理由于假阳性结果导致的额外工作负载.
- 另外,GPT-3.5 Turbo可以预先选引文,以减少手工工作量,在全文审查阶段可能缺少一些文章的权衡.


