基于机器学习的方法来识别研究差距:COVID-19作为一个案例研究.
Alaa Abd-Alrazaq1, Abdulqadir J Nashwan2, Zubair Shah3
1AI Center for Precision Health, Weill Cornell Medicine-Qatar, Doha, Qatar.
JMIR formative research
|March 5, 2024
概括
本研究引入了一种机器学习方法,以识别科学文献中的研究差距,使用COVID-19研究作为案例研究. 该方法有效地确定了未来科学探索的关键领域.
科学领域:
- 计算生物学 计算生物学
- 图书统计学 图书统计学
- 人工智能在医学中的应用
背景情况:
- 识别研究差距的传统方法耗时且可能具有偏见.
- 需要可扩展和创新的方法来系统地评估科学文献.
- 随着COVID-19的爆发,人们越来越需要有效的文献分析.
研究的目的:
- 提出和评估基于机器学习的方法来识别研究差距.
- 为了利用COVID-19开放研究数据集进行案例研究.
- 展示自动化方法在科学发现中的潜力.
主要方法:
- 在CORD-19数据集上使用BERTopic技术进行主题建模.
- 使用的变压器模型和基于类的TF-IDF用于文档嵌入和集群.
- 一个三阶段的过程涉及文件嵌入,集群和主题表示.
主要成果:
- 在COVID-19文献中确定了21个不同的研究缺口领域.
- 将这些差距分为六个主要主题:病毒,危险因素,预防,治疗,医疗保健提供和影响.
- "COVID-19的影响"是最突出的话题,出现在超过一半的研究中.
结论:
- 机器学习方法有效地识别了研究差距,作为未来研究查询的指南.
- 这种方法补充了,而不是取代了传统的文献评论.
- 未来的工作应该包括更新的文献,全文分析和先进的建模技术.


