检索增强生成启用生成预训练变压器4 (GPT-4) 性能用于临床试验查
Ozan Unlu1,2,3,4, Jiyeon Shin1,5, Charlotte J Mailly1,5
1Accelerator for Clinical Transformation, Brigham and Women's Hospital, Boston, MA.
medRxiv : the preprint server for health sciences
|February 19, 2024
概括
采用GPT-4的提取增强生成 (RAG) 准确识别临床试验资格标准,改进了传统的手动选方法,以提高患者选择的效率和准确性.
科学领域:
- 临床试验中的人工智能
- 医疗保健的自然语言处理.
- 临床试验对象查优化
背景情况:
- 传统的临床试验对象查是资源密集的,容易出现错误.
- 大型语言模型 (LLM) 提供了提高选质量和效率的潜力.
- 本研究评估了一种带有生成预训练的变压器版本4 (GPT-4) 驱动的检索增强生成 (RAG) 系统,用于试验标准的识别.
研究的目的:
- 评估 RAG 支持的 GPT-4 系统 (RECTIFIER) 在确定临床试验纳入和排除标准方面的准确性.
- 为了将RECTIFIER的性能与研究人员手动图表审查进行比较.
- 确定AI在提高临床试验查效率和成本效益方面的潜力.
主要方法:
- 开发了基于RAG的问答系统RECTIFIER,使用GPT-4和临床笔记.
- 利用了心力衰竭最佳治疗实施合作计划 (COPILOT-HF) 试验的数据.
- 将RECTIFIER的性能与研究人员的评估和专家临床医生的"黄金标准"进行比较,使用灵敏度,特异性,准确性和MCC.
主要成果:
- RECTIFIER实现了高精度 (97.9%-100%) 和马修斯相关系数 (MCC) (0.837-1),与专家临床医生的评估密切一致.
- 在确定"症状性心力衰竭"标准方面,RECTIFIER的表现优于研究人员 (97.9%对91.7%的准确性).
- 对RECTIFIER的总体敏感性和特异性分别为92.3%和93.9%,超过了研究人员的表现 (90.1%和83.6%).
结论:
- 基于GPT-4的解决方案,如RECTIFIER,显示出提高临床试验查效率和降低成本的巨大潜力.
- 选过程的自动化需要仔细考虑潜在的危险.
- 在患者使用人工智能驱动工具之前,实施缓解策略,例如最终的临床医生审查,至关重要.
更多相关视频
09:30Pre-Implantation Genetic Testing for Aneuploidy on a Semiconductor Based Next-Generation Sequencing Platform
Published on: August 17, 2022
3.1K
09:03Parallel Interrogation of β-Arrestin2 Recruitment for Ligand Screening on a GPCR-Wide Scale using PRESTO-Tango Assay
Published on: March 10, 2020
12.3K
