Auditing widely used biomolecular benchmarks reveals systematic data inconsistencies

Maximilian G Schuh1, Aleksandra Daniluk1, Stephan A Sieber1

  • 1TUM School of Natural Sciences, Department of Biosciences, Chair of Bioorganic Chemistry, Center for Functional Protein Assemblies, Technical University of Munich (TUM) Ernst-Otto-Fischer-Str. 8 85748 Garching Germany stephan.sieber@tum.de.

Chemical Science
|August 1, 2026
PubMed
Summary

Machine learning for drug discovery needs reliable data. This study found hidden flaws like data leakage and inconsistencies in common benchmarks, impacting model performance evaluations.