在Ehr数据中潜伏结构:使用稀疏的NMF重建糖尿病标记物
Ahmed Elhussein1,2, George Hripcsak1,2
1Department of Biomedical Informatics, Columbia University, NY, USA.
medRxiv : the preprint server for health sciences
|April 16, 2025
概括
非负矩阵分解 (NMF) 减少了复杂的电子健康记录 (EHR) 数据的维度. 这种方法保留了糖尿病患者的临床相关信息,在显著减少数据的情况下实现了高精度.
科学领域:
- 数据科学数据科学数据科学
- 生物信息学是一种生物信息学.
- 临床信息学 临床信息学
背景情况:
- 电子健康记录 (EHR) 数据的数量和复杂性正在增加,导致冗余性,稀疏性和分析困难等挑战.
- 高维的临床数据往往掩盖了潜在的模式,阻碍了有效的分析和预测建模.
研究的目的:
- 将非负矩阵因子化 (NMF) 应用于来自II型糖尿病患者的高维EHR实验室数据.
- 为了确定保留临床上重要的信息所需的最小隐性维度.
- 通过学习的表示来评估重建关键临床实验室值 (血糖,HbA1c) 的准确性.
主要方法:
- 非负矩阵因子化 (NMF) 应用于一个高维实验室数据集.
- 患者内部归算和跨患者的概括任务被用于评估.
- 评估了缩小尺寸表示能够重建血糖和HbA1c值的能力.
主要成果:
- 在重建血糖和HbA1c方面获得了临床上可接受的准确性.
- 在保持精度的同时,可实现高达80%的尺寸缩小.
- 在高维数据中确定了一个紧的,低维的潜在结构 (230-300维).
结论:
- 非负矩阵因子化 (NMF) 有效地减少了二型糖尿病患者的电子健康记录数据的维度.
- 在高维临床数据中存在一个低维的潜在结构,使得能够准确地重建关键实验室值.
- 显著的数据减少是可能的,而不会影响临床上有意义的信息,促进更易于处理的分析.


