Comparison of confirmed inactive and randomly selected compounds as negative training examples in support vector

Kathrin Heikamp1, Jürgen Bajorath

  • 1LIMES Program Unit, Chemical Biology and Medicinal Chemistry, Department of Life Science Informatics, Rheinische Friedrich-Wilhelms-Universität, Dahlmannstr. 2, D-53113 Bonn, Germany.

Summary

Choosing negative training data significantly impacts machine learning models for drug discovery. This study reveals that typical benchmarks overestimate support vector machine (SVM) performance in virtual screening compared to real-world applications.