对HIV-1蛋白酶抑制剂耐药性的基准机器学习模型预测:数据集构造和特征表示的影响
Rocío Lucía Beatriz Riveros Maidana1,2, Lucas de Almeida Machado3, Ana Carolina Ramos Guimarães1,2
1Laboratório de Genómica Aplicada e Bioinovac̨ões, Instituto Oswaldo Cruz/Fiocruz, Rio de Janeiro 21040-900, Brazil.
Journal of chemical information and modeling
|September 25, 2025
概括
评估用于预测HIV-1蛋白酶抑制剂耐药性的机器学习模型显示,数据预处理显著影响性能. 物理化学信息后勤回归模型提供与神经网络相比较的准确性,具有更高的可解释性和效率.
科学领域:
- * 计算生物学和生物信息学
- * 机器学习在药物发现中的作用
- * 病毒传染病和抵抗机制
背景情况:
- * 病毒感染中的耐药性,特别是HIV-1病毒,构成了全球主要的健康威胁.
- *机器学习 (ML) 模型越来越多地用于从基因组数据中预测抗病毒药物耐药性.
- *HIV-1蛋白酶抑制剂 (PI) 是一种关键的治疗方法,因此对抗性的预测至关重要.
研究的目的:
- * 系统地评估现有的ML模型来预测HIV-1PI耐药性.
- * 评估不同数据预处理策略对模型性能的影响.
- * 提出和验证一种新的,严格的方法来评估模型通用性.
主要方法:
- *在三个不同的HIV-1蛋白酶数据集上比较了各种ML模型 (神经网络,随机森林,KNN,逻辑回归).
- *研究了不同的预处理技术,包括模两可的序列处理和数据扩展.
- *采用zScales物理化学描述符和Rosetta能量术语作为模型特征.
- * 实施基于集群的验证方法,以进行可靠的概括性评估.
主要成果:
- *数据扩展预处理通过引入冗余性来人工膨胀性能指标.
- *基于集群的验证提供了对模型通用性的更严格,更可靠的评估.
- * 基于物理化学信息的逻辑回归模型 (zScales LR,Rosetta LR) 实现了与复杂神经网络相当的性能.
- *zScales LR在罗塞塔LR的计算效率和解释性方面表现出了卓越的优势.
- * 相互信息分析确定了不同的阻力机制:zScales突出了特定的热点,而罗塞塔则揭示了相互连接的能量网络.
结论:
- * 数据集的构造和预处理选择极大地影响了在阻力预测中明显的ML模型性能.
- *精心选择的物理化学特征可以产生准确和可解释的HIV-1 PI耐药性模型,与复杂的神经网络相竞争.
- * 拟议的基于集群的验证和物理化学特征表示提供了一个强大的框架,用于开发临床相关的耐药性预测工具.


