探索使用开源大语言模型来分析试验信息的探索:用分散元素进行临床试验的案例研究
Ki Young Huh1, Ildae Song2, Yoonjin Kim1
1Department of Clinical Pharmacology and Therapeutics, Seoul National University College of Medicine and Hospital, Seoul, Republic of Korea.
Clinical and translational science
|March 3, 2025
概括
像Llama 3这样的大型语言模型可以有效地分析分散的临床试验 (DCT) 的临床试验数据. 这项研究表明了它们在识别趋势和管理非结构化试验信息方面的潜力.
科学领域:
- 临床信息学 临床信息学
- 医疗保健中的人工智能
- 生物医学数据科学 生物医学数据科学
背景情况:
- 分散临床试验 (DCT) 正在引起人们的兴趣,但由于数据不一致,分析其趋势具有挑战性.
- 现有的方法在试验注册表中的异质性和非标准化术语方面扎.
研究的目的:
- 探索Llama 3大型语言模型的有效性,用于分析分散的临床试验 (DCT) 的趋势.
- 评估不同Llama 3模型尺寸的性能,并对DCT数据提取和分类进行微调.
主要方法:
- 使用Llama 3 (8b,微调8b,70b) 来分析来自ClinicalTrials.gov (2018-2023) 的药物试验数据.
- 采用快速工程来分类DCT和提取分散的元素.
- 在测试数据集上评估模型灵敏度和预测值,然后选完整的数据集.
主要成果:
- 微调使模型的灵敏度从0.0357提高到0.5385;进一步的精细化使积极的预测值增加到0.9167.
- 70b参数Llama 3模型对于准确提取去中心化元素至关重要.
- 在6年数据集中确定了692个DCT,其中大多数位于第二阶段 (213) 和第四阶段 (162).
结论:
- 大型语言模型显示了分析非结构化临床试验数据的巨大潜力,克服了传统方法的局限性.
- 仔细管理潜在偏差对于在临床试验分析中可靠应用这些AI模型至关重要.
- 这种方法有助于更有效地了解分散的临床试验趋势和特征.
更多相关视频
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
15.7K
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
7.0K
