用机器学习和大型语言模型检测基因组流行病学发表文章中的患者元数据
Ari Z Klein1, Davy Weissenbacher2, Karen O'Connor1
1Department of Biostatistics, Epidemiology, and Informatics, University of Pennsylvania, Philadelphia, PA, USA.
概括
自然语言处理方法可以有效地检测与SARS-CoV-2基因组序列相关的患者元数据. 生物医学BERT模型在基因组流行病学中的这一关键任务中显著优于生成AI.
科学领域:
- 计算生物学是一种计算生物学.
- 生物信息学是一种生物信息学.
- 基因组流行病学基因组流行病学
背景情况:
- 患者元数据对于基因组流行病学至关重要,但往往与数据库中的基因组序列断开了联系.
- 这种脱节限制了发表的研究对理解病毒爆发的有用性.
研究的目的:
- 开发和评估用于检测与基因组测序报告相关的患者元数据的自然语言处理 (NLP) 方法.
- 在已发表的文章中关注SARS-CoV-2 (严重急性呼吸系统综合征冠状病毒2).
主要方法:
- 在从LitCovid获得的PubMed文章样本上训练并验证了基于BERT的分类器.
- 通过使用各种提示策略进行生成AI (Llama-3-70B LLM) 的实验.
- 手动注释报告SARS-CoV-2序列和相关患者元数据的句子.
主要成果:
- 基于BERT的模型预先训练了生物医学/COVID-19体,实现了比一般领域模型更高的性能 (F1得分=0.776与BiomedBERT-Large-Abstract).
- 生成型人工智能方法产生较低的F1分数 (0.558) 并超过所有机器学习分类器.
结论:
- NLP方法,特别是基于BERT的分类器,可以有效地将患者元数据与已发表文献中的SARS-CoV-2基因组序列联系起来.
- 这些方法提高了基因组流行病学对病毒爆发的公共卫生反应的实用性和效率.


