Related Experiment Video
Updated: May 2, 2026

09:00
TBase - an Integrated Electronic Health Record and Research Database for Kidney Transplant Recipients
Published on: April 13, 2021
5.3K
Optimized dual threshold entity resolution for electronic health record databases--training set size and active
Erel Joffe1, Michael J Byrne1, Phillip Reeder1
1School of Biomedical Informatics, The University of Texas Health Science Center at Houston, Houston, TX.
AMIA ... Annual Symposium Proceedings. AMIA Symposium
|February 20, 2014
Summary
Optimizing entity-resolution algorithms for clinical databases significantly reduces manual review. Particle swarm optimization and active learning methods achieve high accuracy with smaller training datasets for duplicate record identification.
Area of Science:
- Health Informatics
- Data Science
- Biomedical Data Management
Background:
- Clinical databases often contain duplicate patient records, necessitating robust entity-resolution methods.
- General entity-resolution algorithms require dataset-specific parameter tuning for optimal accuracy.
Purpose of the Study:
- To determine optimal training set sizes for probabilistic, deterministic, and Fuzzy Inference Engine (FIE) algorithms.
- To evaluate parameter optimization using the particle swarm approach and active learning for duplicate record identification.
Main Methods:
- Tuning parameters of probabilistic, deterministic, and Fuzzy Inference Engine (FIE) algorithms using particle swarm optimization.
- Evaluating training set sizes ranging from 2,000 to 10,000 record-pairs.
- Assessing marginal uncertainty sampling for active learning strategies.
Main Results:
- Parameter optimization substantially reduced manual review requirements across all tested algorithms.
- Fuzzy Inference Engine (FIE) achieved 98.1% accuracy with precision=1.0.
- Optimal performance was achieved with 10,000 training record-pairs; active learning yielded comparable results with 3,000 records.
Conclusions:
- Automated parameter optimization is effective for improving entity-resolution performance in clinical databases.
- Targeted sampling strategies, such as active learning, can significantly reduce the necessary training data size.
- Optimized algorithms enhance the efficiency and accuracy of identifying duplicate patient records.