使用大型语言模型来评估AI干预随机对照试验与CONSORT-AI的一致性:跨部门调查
Xufei Luo1,2,3,4,5, Zeming Li6, Zhenhua Yang7
1Evidence-Based Medicine Center, School of Basic Medical Sciences, Lanzhou University, 199 Donggang West Road, Chengguan District, Lanzhou, 730000, China, 86 13893104140.
Journal of medical Internet research
|September 26, 2025
概括
大型语言模型 (LLM) 在评估研究一致性方面表现有前途. 在评估人工智能 (AI) 随机对照试验 (RCT) 与CONSORT-AI标准相比,GPT-4变体的表现最好,尽管人类监督仍然至关重要.
科学领域:
- 医疗研究中的人工智能
- 临床试验报告标准 临床试验报告标准
- 自然语言处理应用程序
背景情况:
- 大型语言模型 (LLM) 显示了评估研究一致性的潜力.
- 之前的研究使用了LLM来评估随机对照试验 (RCT) 摘要与CONSORT-Abstract指南相比.
- 当通过LLM进行评估时,AI干预性RCT遵循CONSORT-AI标准的一致性尚未得到充分确立.
研究的目的:
- 使用基于LLM的聊天机器人评估AI干预性RCT与CONSORT-AI标准的一致性.
- 确定不同LLM模型在评估遵守CONSORT-AI指南时的表现.
主要方法:
- 一项涉及6个LLM模型的横截面研究,以评估JAMA网络开放的41个人工智能干预的RCT.
- 查询通过API提交,确定性响应的温度设置为0.
- 分析了整体一致性得分 (OCS),回忆,评审者之间的可靠性和内容一致性,并对LLM响应进行了独立验证.
主要成果:
- GPT-4变种呈现出最高的平均OCS,gpt-4-0125预览达到86.5% (JAMA作者) 和81.6% (研究作者).
- GPT-3.5-turbo-0125显示了最低的平均OCS (61.9%和63.0%).
- CONSORT-AI项目2 ("在输入数据层面列出包含和排除标准") 得到了最差的评估 (48.8%的OCS),而项目1,5,8和9超过了80%的OCS.
结论:
- GPT-4变种在评估RCT与CONSORT-AI的一致性方面表现出强大的能力.
- 快速改进是必要的,以提高基于LLM的评估的精度和一致性.
- 人类监督和专业知识对于医疗研究中可靠的AI驱动评估至关重要,提高了评估效率和质量.

