机器学习方法的比较,用于预测使用化学结构和目标转录组数据的肝毒性潜力
Tia Tate1, Grace Patlewicz1, Imran Shah1
1Center for Computational Toxicology and Exposure, Office of Research and Development, U.S. Environmental Protection Agency, Research Triangle Park, North Carolina 27709, USA.
Computational toxicology (Amsterdam, Netherlands)
|July 12, 2024
概括
解决动物毒性数据中的偏差对于准确的机器学习 (ML) 预测至关重要. 这项研究探讨了采样方法来平衡毒性数据集,发现定制的ML工作流程对于可靠的毒性预测至关重要.
科学领域:
- 毒理学 毒理学 毒理学
- 计算化学的计算化学
- 生物信息学是一种生物信息学.
背景情况:
- 对动物的毒性测试是资源密集型的,这在物质评估中造成了瓶.
- 现有用于训练机器学习 (ML) 模型的毒性数据集通常因可能导致毒性的物质的选择而有偏见.
- 这种偏差可以显著影响用于毒性评估的ML模型的预测性能.
研究的目的:
- 调查数据平衡策略对ML肝毒性模型预测性能的影响.
- 评估各种采样方法,以减轻毒性数据集中的类不平衡.
- 为了比较不同的ML算法和特征集在预测毒性结果中的性能.
主要方法:
- 利用化学结构和/或转录基因数据的监督ML工作流程来预测肝毒性.
- 应用各种采样方法 (过量采样,不足采样) 来平衡不平衡的体内毒性数据.
- 在多个ML模型中评估了18个研究毒性结果组合,包括人工神经网络,随机森林和k-最近邻居 (k-NN).
主要成果:
- 对于慢性肝脏影响的不平衡数据,平均CV F1得分为0.735.
- 过量抽样方法降低了性能至0.639,而不足抽样导致0.523.
- 与不平衡数据 (0.089) 相比,发育性肝毒性显示过量采样 (CV F1 平均值为 0.234) 的性能有所改善.
- 模型性能受到数据集特征,模型类型和平衡策略的影响.
结论:
- 类不平衡显著影响毒性预测中的ML模型性能.
- 为准确的毒性预测,建议量身定制ML工作流程,考虑数据平衡,并从更简单的分类器开始.
- 选择平衡方法和ML模型对于优化不同毒性终点的预测准确性至关重要.


