Related Experiment Video
Updated: Apr 27, 2026

10:56
A User-friendly and Powerful R Analysis of Large-scale Datasets
Published on: November 4, 2025
461
Are bigger data sets better for machine learning? Fusing single-point and dual-event dose response data for
Sean Ekins1, Joel S Freundlich, Robert C Reynolds
1Collaborations in Chemistry , 5616 Hilltop Needmore Road, Fuquay-Varina, North Carolina 27526, United States.
Journal of Chemical Information and Modeling
|June 27, 2014
Summary
Combining tuberculosis drug screening data improves machine learning models without sacrificing predictive power. Models trained on fewer compounds show comparable results to those trained on vast datasets, optimizing screening strategies.
Area of Science:
- Drug discovery
- Computational biology
- Machine learning
Background:
- Tuberculosis (TB) remains a significant global health challenge requiring novel treatments.
- Extensive phenotypic screening data for Mycobacterium tuberculosis (Mtb) is publicly available.
- Machine learning (ML) can leverage existing data to build predictive models for drug discovery.
Purpose of the Study:
- To investigate if combining large single-point screening data with smaller, high-quality dual-event dose-response data improves ML models for TB drug discovery.
- To assess the predictive performance of various ML models using different data combinations.
Main Methods:
- Bayesian machine learning was employed to evaluate 12 models.
- Models were trained and tested using diverse datasets, including single-point, dual-event, and combined data.
- Performance was assessed using receiver operator characteristic (ROC) curves for internal and external validation.
Main Results:
- Combining single-point and dual-event data did not reduce model predictive ability (internal ROC: 0.83-0.91, external ROC: 0.62-0.83).
- Models trained on 1200-5000 compounds demonstrated predictive performance comparable to models trained on 25,000-35,000 compounds.
- Dual-event models showed lower performance (internal ROC: 0.6-0.83, external ROC: 0.54-0.83).
Conclusions:
- Integrating diverse TB screening data enhances ML model development.
- Smaller, well-curated datasets can yield highly predictive models, challenging the need for massive screening efforts.
- Results inform strategies for efficient high-throughput screening versus focused compound testing.
