大型语言模型能否近似化重症监护的元分析结果? 一个元研究研究研究
Michael Pratte1, Shawn Thirukumar2, Caseng Zhang3
1University of Toronto, Interdivisional Department of Critical Care, Canada.
Journal of critical care
|November 20, 2025
概括
大型语言模型 (LLM) 显示出在重症监护中快速综合证据的前景,与传统的对效应方向和规模的元分析达成高度一致.
科学领域:
- 人工智能在医学中的应用
- 临床证据综合研究
- 生物医学信息学 生物医学信息学
背景情况:
- 大型语言模型 (LLM) 可以处理大量的文本数据,用于临床问题解答.
- 带有元分析 (SRMA) 的系统审查是劳动密集型的,为LLM评估提供了机会.
- 在医疗保健中,LLM提供了一种新的证据综合方法.
研究的目的:
- 评估OpenAI的o3 DeepResearch模型对临床证据综合的近似能力.
- 将LLM产生的效应方向,大小和证据确定性与已发表的元分析进行比较.
- 评估LLM作为一种在重症监护医学的证据综合工具.
主要方法:
- 标准化的PICO提示是从23个系统性审查和重症监护的元分析中创建的.
- 对效应规模和证据确定性的LLM估计与原来的SRMA调查结果进行了比较.
- 这项研究利用了高影响力重症监护期刊出版物的便利样本.
主要成果:
- 该LLM在效果大小方面实现了83%的一致性,在效果方向方面达到91%.
- 证据确定性的一致性达到91%.
- 差异来自不同的研究选择,而不是LLM幻觉.
结论:
- 在重症监护中,LLM显示出作为一种快速证据综合的工具的潜力.
- 在许多方面,LLM的成果与传统的元分析相比较.
- 法律学可以增强临床决策和简化研究工作流程.

