使用LightGBM提高临床文献监测系统的效率
Cynthia Lokker1, Wael Abdelkader1, Elham Bagheri1
1Health Information Research Unit, Department of Health Research Methods, Evidence, and Impact, McMaster University, Hamilton, Ontario, Canada.
PLOS digital health
|September 23, 2024
概括
机器学习 (ML) 模型显著提高了识别高质量的临床研究的效率. 渐变增强的ML减少了将研究分类所需的工作45%,加强了对证据用户的文献监督.
科学领域:
- 生物医学信息学 生物医学信息学
- 医疗保健中的人工智能
- 基于证据的医学基于证据的医学.
背景情况:
- 在文献数据库中布尔式搜索在识别方法上健全和临床相关研究方面表现不佳.
- 根据方法质量有效分类临床研究文章对于文献监测计划至关重要.
研究的目的:
- 探索机器学习 (ML) 以有效地根据方法质量分类临床研究文章.
- 开发和测试二元分类模型,以预测临床研究文章具有高方法质量的概率.
主要方法:
- 通过使用PubMed索引的97,805篇文章标题和摘要 (2012-2018) 的数据集训练了超过12,000个模型,手动评估了严格性和临床相关性.
- 采用不平衡,过量采样和不足采样的数据集来训练模型,优先考虑99%的灵敏度以获得高严度.
- 选择和测试的模型,包括一个LightGBM (梯度提升机) 算法,在回顾性 (30,424 篇文章,2020) 和前性 (5,253 篇文章) 验证集.
主要成果:
- 最终的LightGBM模型在回顾性验证中实现了57%的特异性,在前性验证中达到53%,同时保持了高灵敏度.
- 在前性研究中,需要阅读的文章数量从4.63 (布尔式搜索) 减少到3.68 (ML).
- 梯度增强的ML模型表明,对高质量的临床研究研究进行分类所需的工作减少了45%.
结论:
- 机器学习,特别是梯度增强模型,在识别方法上健全的临床研究的效率上提供了显著的改进.
- 这种ML方法增强了文献监测,从而更有效地向临床医生和其他最终用户传播高质量的证据.


