使用序列信息和机器学习方法准确识别血凝素
Xidan Zou1, Liping Ren2, Peiling Cai3
1School of Life Science and Technology, Center for Informational Biology, University of Electronic Science and Technology of China, Chengdu, China.
Frontiers in medicine
|November 29, 2023
概括
这项研究开发了一种计算模型,以准确识别血凝素 (HA),这是流感病毒进入的关键蛋白质. 该模型实现了高精度,有助于开发向性流感药物和疫苗.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 病毒学 病毒学
背景情况:
- 血凝素 (HA) 对于流感病毒进入和感染至关重要.
- HA是开发流感抗病毒药物和疫苗的重要目标.
- 目前用于HA识别的in-silico方法是有限的.
研究的目的:
- 设计和开发一种计算模型,用于精确的体内血凝素 (HA) 鉴定.
- 促进针对性疫苗和抗流感药物的开发.
主要方法:
- 一个基准数据集由106个HA和106个非HA序列组成,从UniProt.
- 基于序列的特征被提取和优化.
- 使用堆叠算法和四种机器学习方法构建了一个集成分类器模型.
主要成果:
- 该模型在5倍交叉验证中实现了95.85%的准确性和0.9863的ROC曲线面积.
- 在独立测试中,该模型显示了93.18%的准确性和0.9793.3的ROC曲线面积.
- 开发的模型显示出出色的预测性能.
结论:
- 拟议的计算模型为HA识别提供了一个有效的工具.
- 这种工具可以帮助生物化学研究人员研究HA和开发流感治疗方法.


