相关实验视频
Updated: May 3, 2026

05:37
An R-Based Landscape Validation of a Competing Risk Model
Published on: September 16, 2022
2.2K
随机临床试验文章报告质量的大型语言模型分析:系统审查
Apoorva Srinivasan1, Jacob Berkowitz1, Nadine A Friedrich1
1Department of Computational Biomedicine, Cedars Sinai Medical Center, Los Angeles, California.
JAMA network open
|August 28, 2025
概括
一个新的大型语言模型 (LLM) 管道有效评估随机临床试验 (RCT) 报告质量,确定分配隐藏和外部有效性讨论等关键要素的持续差距.
科学领域:
- 临床试验报告
- 医学的人工智能
- 生物医学研究的透明度
背景情况:
- 随机临床试验 (RCT) 的不完整报告阻碍了偏差评估和可重复性.
- 为了确保RCT遵守综合报告标准 (CONSORT) 的指导方针,手动审计是不可扩展的.
- 需要自动化方法来评估RCT报告的质量.
研究的目的:
- 开发和验证用于自动化CONSORT指南评估的零射击大型语言模型 (LLM) 管道.
- 分析随着时间的推移,生物医学学科的报告质量的趋势,以及与试验特征的关系.
主要方法:
- 在PubMed上索引的RCT (1966-2024) 的系统审查,从PDF转换为XML.
- 在CONSORT文本分类模型 (CONSORT-TM) 基准上测试并根据专家评价进行验证的LLM (Chat GPT-4o-mini).
- 通过分析21项CONSORT项目报告,LLM对大量RCT进行了评估.
主要成果:
- 该LLM表现出很高的表现,与专家评价的准确率达到了91.7%,并在CONSORT-TM基准上获得了0.86的宏观F1得分.
- 平均CONSORT合规率从27.3% (1966-1990) 增加到57.0% (2010-2024),但分配隐藏 (16.1%) 和外部有效性讨论 (1.6%) 等关键因素仍未得到充分报道.
- 在不同学科中报告的遵守率有很大差异 (药理学为35. 2%,泌尿学为63. 4%),与试验特征的关联很小.
结论:
- 一个零射击的LLM可以在规模上有效地审计CONSORT的遵守,提供对报告质量的洞察力.
- 报告关键试验要素的持续缺陷需要有针对性的干预措施.
- 这些发现强调需要加强编辑行动,以提高生物医学研究的透明度和可重复性.

