Potential limitations in COVID-19 machine learning due to data source variability: A case study in the nCov2019
Carlos Sáez1, Nekane Romero1, J Alberto Conejero2
1Biomedical Data Science Lab, Instituto Universitario de Tecnologías de la Información y Comunicaciones, Universitat Politècnica de València, Camino de Vera s/n, Valencia 46022, España.
Machine learning for coronavirus disease 2019 (COVID-19) requires representative data. Data source variability introduces bias, hindering reliable and generalizable models. Addressing data quality is crucial for accurate COVID-19 research.
Area of Science:
- Machine Learning
- Epidemiology
- Data Science
Background:
- Reliable machine learning for coronavirus disease 2019 (COVID-19) is hampered by a lack of representative data.
- Insufficient data sharing and variable data quality, particularly source variability, are significant bottlenecks.
- Understanding data source variability is critical for mitigating bias in COVID-19 research.
Purpose of the Study:
- To investigate potential biases introduced by data source variability in COVID-19 machine learning.
- To explore the discovery and classification of COVID-19 severity subgroups using patient symptoms and comorbidities.
- To highlight the impact of data source variability on model generalizability.
Main Methods:
- Utilized the publicly available nCov2019 dataset containing patient-level data from multiple countries.
- Analyzed cases from countries with the highest prevalence, dividing them into subgroups based on distinct severity manifestations.
- Focused on symptom and comorbidity data for subgroup discovery and classification.
Main Results:
- Identified distinct severity subgroups within COVID-19 cases from different countries.
- Demonstrated that data source variability can reduce the representativeness of training data.
- Highlighted the risk of increased model complexity and overfitting due to data variability.
Conclusions:
- Data source variability is a key factor contributing to bias in distributed research networks for COVID-19.
- Systematic assessment and reporting of data source variability and quality are essential for COVID-19 data sharing.
- Improving data quality is paramount for developing reliable and generalizable machine learning models in COVID-19 research.
Related Concept Videos
Single Nucleotide Polymorphisms-SNPs
Variability: Analysis
The range is a simple measure of variability, indicating the difference between the highest and...
Bias in Epidemiological Studies
Confounding in Epidemiological Studies
Systematic Error: Methodological and Sampling Errors
Sampling errors originate from improper sampling methods or the wrong sample population. These errors can be minimized by refining the sampling strategy. Defective instruments or faulty calibrations are the sources of instrumental...
Improving Translational Accuracy


