生成合成的临床数据,以生成的对抗网络捕捉阶级不平衡的分布:使用抗逆转录病毒治疗艾滋病病毒的例子
Nicholas I-Hsien Kuo1, Federico Garcia2, Anders Sönnerborg3
1Centre for Big Data Research in Health, the University of New South Wales, Sydney, Australia.
Journal of biomedical informatics
|July 14, 2023
概括
这项研究引入了一种新的生成对抗网络 (GAN) 模型,配备了变异自编码器 (VAE) 和外部内存,以创建多样化,现实的合成临床数据. 该方法克服了GAN的局限性,使医疗保健机器学习模型的安全开发成为可能.
科学领域:
- 医疗信息学 医疗信息学
- 机器学习 机器学习
- 数据 隐私 数据 隐私 数据
背景情况:
- 临床数据的保密性限制了机器学习的发展.
- 生成对抗网络 (GAN) 产生合成数据,但遭受模式崩,导致偏见和低多样性.
- 在临床数据集中,不平衡的类分布是常见的,这给模型培训带来了挑战.
研究的目的:
- 提出一个增强的GAN框架,包括一个变量自编码器 (VAE) 和外部内存.
- 为了生成合成的临床数据,准确地表示不平衡的阶级分布.
- 为了克服GAN的局限性,例如模式崩,并增强患者队列多样性.
主要方法:
- 开发了一个扩展的GAN框架,集成一个VAE和一个外部内存机制.
- 合成了针对HIV的抗逆转录病毒疗法 (ART) 的数据集.
- 根据类分布准确性,可变现实主义,可变间现实主义,患者披露风险和下游机器学习实用性来评估合成数据.
主要成果:
- 提出的方法成功生成了具有准确不平衡类分布的合成数据.
- 实现了0.095%的患者披露风险,明显低于监管门 (9%).
- 综合数据在医疗保健下游机器学习模型开发方面具有很高的实用性.
结论:
- 增强的GAN框架与VAE和外部内存有效生成现实的,多样化的合成临床数据.
- 这种方法解决了GAN的局限性,并促进了医疗保健机器学习应用的安全开发.
- 该方法有望通过安全的数据合成,在医疗保健中实现更广泛的机器学习研究和应用.


