CATI: A medical context-enhanced framework for diagnosis code assignment in the UK Biobank study

Yue Shen1, Jie Wang1, Zhe Wang1

  • 1MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China, Hefei, Anhui, 230027, China.

Insights

This study introduces CATI, a novel framework for assigning accurate diagnosis codes in large biobanks by integrating textual data and disease hierarchies. CATI improves upon existing methods, enhancing disease-related research through better patient cohort formation.

Area of Science:

  • Bioinformatics
  • Medical Informatics
  • Computational Biology

Background:

  • Accurate diagnosis coding is essential for large-scale biobank studies and downstream disease research.
  • Current methods often neglect valuable textual medical information and the hierarchical nature of disease classification systems.
  • Missing diagnosis codes in biobanks limit the utility of patient data for clinical research.

Purpose of the Study:

  • To develop and evaluate CATI, a medical context-enhanced framework for improved diagnosis code assignment in large biobanks.
  • To integrate textual details and disease hierarchy into a unified model for more accurate coding.
  • To address the challenge of missing diagnosis codes for patients in biobank datasets.

Main Methods:

  • CATI framework integrates textual details from key features and disease hierarchy using text embeddings from BioBERT via prompt tuning.
  • A novel convolution layer is developed to effectively propagate information between adjacent diagnosis codes, leveraging the hierarchical structure.
  • The study utilizes UK Biobank data, focusing on Phecodes and ICD-10 codes as standard disease formats.

Main Results:

  • CATI demonstrates superior performance compared to state-of-the-art methods for both Phecodes and ICD-10 code assignment.
  • Achieved at least a 5.16% improvement in average AUROC for unseen disease codes.
  • Showcased an 8.68% increase in average AUPRC for disease codes with limited training instances (1000-10000).

Conclusions:

  • CATI effectively enhances diagnosis code assignment by incorporating medical context from textual data and disease hierarchies.
  • The framework facilitates the creation of well-defined cohorts for downstream biomedical research.
  • CATI offers a valuable approach for complex healthcare tasks by leveraging rich medical information.