在系统性审查中利用大语言模型进行高效的数据提取:快速工程的作用
Molly Murton1, Ellie Boulton2, Shona Cross1
1Costello Medical Consulting Limited Cambridge UK.
Cochrane evidence synthesis and methods
|October 30, 2025
概括
大型语言模型 (LLM) 在随机临床试验 (RCT) 的系统文献评论 (SLR) 中显示出数据提取自动化的前景. 虽然对于基线数据有效,但人类监督对于复杂的疗效和不良事件信息至关重要.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 基于证据的医学基于证据的医学.
背景情况:
- 系统性文献审查 (SLR) 对基于证据的医学至关重要,但在随机临床试验 (RCT) 的资源密集型数据提取方面面临挑战.
- 大型语言模型 (LLM) 提供了自动化数据提取的潜力,但它们在各种疾病中的有效性需要彻底调查.
研究的目的:
- 开发和评估GPT-4o的快速工程策略,从RCT中提取数据.
- 评估LLM在三个不同疾病领域的数据提取方面的表现:非小细胞肺癌,子宫内膜癌和多变性心肌病变.
主要方法:
- 对GPT-4o的快速工程策略的代改进.
- 对未见的RCT数据进行测试提示,并将LLM提取与人类提取进行比较.
- 使用F1分数,精度,回忆和百分比准确度进行性能评估.
主要成果:
- 在提取研究和基线特征方面,LLM表现出高的有效性,经常与人类的表现相匹配 (测试F1得分>0.85).
- 提取复杂的疗效和不良事件数据提出了挑战,测试F1得分较低 (0.220.50).
- 提示在疾病区域之间具有前途,但变化的可转移性,需要对疾病特定的提示进行细化.
结论:
- 通过快速工程增强的LLM可以显著增强SLR数据提取过程.
- 人类监督对于确保准确性至关重要,特别是在复杂和细微的数据方面.
- 随着技术的进步,对人工智能工具的持续验证对于保持证据合成的质量和可靠性至关重要.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.0K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
