半监督的双重深度学习时间风险预测 (SeDDLeR) 与电子健康记录
Isabelle-Emmanuella Nogues1, Jun Wen2, Yihan Zhao3
1Department of Biostatistics, Harvard T.H. Chan School of Public Health, United States of America.
Journal of biomedical informatics
|July 14, 2024
概括
SeDDLeR算法有效地预测使用有限标签的电子健康记录的临床事件. 它在准确性上优于现有的方法,为临床决策提供了潜在的潜力.
科学领域:
- 计算生物学和生物信息学
- 机器学习在医疗保健中的应用
- 临床信息学是一种临床信息学.
背景情况:
- 准确的风险预测对于医疗保健规划至关重要,使用电子健康记录 (EHR) 来获得时间数据.
- 基于EHR的风险预测面临的挑战包括缺乏黄金标准结果,复杂的风险因素相互作用和不准确的诊断代码.
- 在EHR数据中确定临床事件的确切发病时间是风险预测模型的一个重大障碍.
研究的目的:
- 开发一个半监督的双重深度学习时间风险预测 (SeDDLeR) 算法.
- 为了利用广泛的未标记的纵向EHR数据,加上最小的黄金标准标签来预测风险.
- 预测随访期间发生的临床事件的二进制状态.
主要方法:
- SeDDLeR构建了一个来自EHR的替代事件发病状态.
- 该算法使用深度学习来校准代孕对黄金标准发病状态的校准.
- 一种半监督的深度学习方法结合了校准的替代品和黄金标准标签,使用时间内核权重和时间动态和缺失数据的门式循环单位 (GRU).
主要成果:
- 与STM和DeepHit等基准方法相比,SeDDLeR在模拟研究和MGB生物库T2D预测中表现优越.
- 该算法在预测2型糖尿病风险方面获得了最好的C统计 (0.815) 和平均时间特定AUC (0.778).
- 统计学意义得到证实,P值表明SeDDLeR的表现优于竞争对手.
结论:
- SeDDLeR能够在现实世界EHR和合成数据中实现强大的风险预测模型训练,具有最小的标记事件时间.
- 该算法显示了将其整合到临床试验招聘流程中的潜力.
- SeDDLeR可以成为增强临床决策的宝贵工具.


