Related Experiment Video
Updated: Nov 5, 2025

07:15
Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
7.1K
Effects of Image Quantity and Image Source Variation on Machine Learning Histology Differential Diagnosis Models.
Elham Vali-Betts1, Kevin J Krause1, Alanna Dubrovsky2
1Department of Pathology and Laboratory Medicine, University of California Davis School of Medicine, Sacramento, CA, USA.
Journal of Pathology Informatics
|May 20, 2021
Summary
Machine learning models for histology image classification improve with diverse training data. Combining data from multiple institutions and increasing image quantity enhances diagnostic accuracy and generalizability for medical education.
Area of Science:
- Medical Education
- Computational Pathology
- Artificial Intelligence in Medicine
Background:
- Histology is fundamental to medical training, requiring diagnostic competency.
- Machine learning (ML) offers potential for developing advanced histology learning tools.
- Convolutional neural networks (CNNs) are a type of ML model with potential for image classification.
Purpose of the Study:
- To develop a generalizable multi-classification model using a CNN for classifying human tissue images.
- To assess the model's ability to provide differential diagnoses for histological entities.
- To explore the impact of training data characteristics on model generalizability.
Main Methods:
- Acquired three institutional and one generalizability test datasets with 38 tissue categories.
- Trained CNN models using varying data quantities and sources (single vs. multiple institutions).
- Tested model performance on internal validation, external institutional, and Google image search data using accuracy, sensitivity, specificity, and F1-score.
Main Results:
- Model generalizability depends on training data source diversity and quantity.
- Models trained on single-institution data showed poor external performance.
- Increasing data source diversity improved generalizability, even with fewer images.
- Optimal generalizability was achieved with diverse, high-quantity training datasets (2280 images from multiple sources).
Conclusions:
- Data diversity is crucial for developing generalizable ML models in histology.
- Optimal ML model performance requires incorporating both data diversity and quantity.
- This approach can enhance histology learning platforms and diagnostic support.

