大型语言模型的性能,在假牙中进行系统审查任务
Rata Rokhshad1, Parisa Motie2, Mohammadjavad Shirani3
1Resident, Department of Pediatric Dentistry, School of Dentistry, Loma Linda University, Loma Linda, Calif.
The Journal of prosthetic dentistry
|March 13, 2026
概括
大型语言模型 (LLM) 显示出改善系统审查 (SRs) 的前景,特别是在数据提取方面. 然而,由于它们在不同任务中的性能变化,需要持续的人类监督以获得准确可靠的结果.
科学领域:
- 图书统计学 图书统计学
- 研究中的人工智能.
- 系统审查方法论 系统审查方法论
背景情况:
- 系统性审查 (SRs) 对于证据综合至关重要,但往往耗时且资源密集.
- 大型语言模型 (LLM) 提高SR流程效率的潜力在很大程度上仍未被探索.
研究的目的:
- 评估四个LLM (GPT-4,Gemini,Claude,Elicit) 在执行关键的SR任务中的准确性和可靠性.
- 在全文选,数据提取和随时间推移的偏差评估风险方面评估LLM绩效.
主要方法:
- 系统搜索确定了59个用于选的文章和31个用于数据提取的文章.
- 采用了三方面提示策略 (基于人,少数人学习,PICO标准).
- 用准确度,精度,F1得分,灵敏度,特异性,数据提取质量得分和Cohen kappa对偏差风险的协议来衡量LLM的表现.
主要成果:
- 克劳德在全文选中表现出最高的灵敏度 (97%);克劳德和Elicit实现了86%的准确性和87%的F1分数.
- GPT-4在数据提取方面表现出色,平均得分为5.0;Claude和Gemini表现相似.
- 与专家达成的偏见风险评估协议在不同标准上从55%到90%不等.
结论:
- 法律法规提供了提高系统审查效率的潜力,特别是在数据提取方面.
- 不同的LLM和SR任务中的可变性能强调了对人类监督的需求.


