人与人工智能对比:评估ChatGPT在进行慢性疼痛研究中的meta-analysis发表的系统审查中的表现
Anam Purewal1, Kalli Fautsch2, Johana Klasova2
1Department of Orthopedic Surgery and Rehabilitation Medicine, SUNY Downstate Health Sciences University, Brooklyn, New York, USA.
Regional anesthesia and pain medicine
|February 16, 2025
概括
人工智能 (AI) 在系统审查的选中表现出适度的准确性,但在数据聚合和元分析计算方面表现出色. 人类监督对于确保人工智能辅助研究的准确性至关重要.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 基于证据的医学基于证据的医学.
背景情况:
- 人工智能 (AI),包括像ChatGPT这样的大型语言模型,显示出对简化研究的承诺.
- 系统性审查和元分析对于以证据为基础的医学至关重要,但需要大量的时间.
- 人工智能在对元分析进行系统审查中的实用性需要评估.
研究的目的:
- 用元分析评估ChatGPT在执行系统性审查的关键任务中的准确性.
- 在系统审查方法中,比较ChatGPT的性能与人类执行的步骤.
主要方法:
- 一项验证研究利用了已发表的关于脊髓刺激后情绪功能元分析的数据.
- 聊天GPT-4o进行了标题/摘要选,全文研究选择和数据聚合.
- 绩效指标包括准确性,敏感性,特异性,PPV和NPV;评估了聚合估计和森林地块的差异.
主要成果:
- 标题/摘要选:ChatGPT实现了70.4%的准确性,54.9%的敏感性和80.1%的特异性.
- 全文选:准确率为68.4%,敏感率为75.6%,特异性为66.8%.
- 森林地块的数据聚合非常准确 (100%的聚合平均差异,CI和大多数异质性估计),少量tau平方差异.
结论:
- 在系统性审查的选和研究选择任务中,ChatGPT表现出适度到中度的准确性.
- 聊天GPT在数据聚合和元分析计算方面表现良好,包括异质性评估.
- 像ChatGPT这样的AI工具可以增强系统审查,但人类监督对于准确性和完整性至关重要.


