使用合成健康数据对分析可复制性的评估
Khaled El Emam1,2,3, Lucy Mosquera4,5, Xi Fang4
1School of Epidemiology and Public Health, University of Ottawa, Ottawa, ON, Canada. kelemam@ehealthinformation.ca.
生成合成健康数据需要至少十个数据集,以确保准确的分析. 序列合成模型为健康数据实用性提供了比GAN更好的可复制性.
科学领域:
- 医疗信息学 医疗信息学
- 数据科学数据科学数据科学
- 生物统计学 生物统计学
背景情况:
- 合成数据生成是共享健康数据的隐私保护方法.
- 确保合成数据的高实用性和可复制性对于有效的人口推断至关重要.
研究的目的:
- 评估用于后勤回归工作负载的合成健康数据的可复制性.
- 为了比较序列合成和生成对抗网络 (GAN) 在合成数据生成中的性能.
主要方法:
- 使用三个真实世界数据集进行的模拟研究.
- 评估了8个可重复性指标,包括决策协议,估计协议和统计能力.
- 合成数据的分析使用多次归算和组合规则,最多可用于20个数据集.
主要成果:
- 使用至少十个组合数据集进行序列合成,实现了高决策和估计一致性,低偏差和名义置信区间覆盖率.
- 与顺序合成相比,生成对抗网络 (GAN) 的可复制性较低.
- 没有结合规则或使用单个数据集的分析导致错误的结果;放大提供了边际收益.
结论:
- 为了获得可靠的结果,合成健康数据的统计分析应该结合至少十个生成数据集的分析.
- 序列合成模型证明了健康研究工作负载的良好可复制性.
- 在所有测试的模型和数据集中,隐私风险很低.
更多相关视频
06:55Inverse Probability of Treatment Weighting Propensity Score using the Military Health System Data Repository and National Death Index
Published on: January 8, 2020
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
相关概念视频
Types of Biopharmaceutical Studies: Controlled and Non-Controlled Approaches
Non-controlled studies, commonly employed for initial exploration, lack a control group, rendering them susceptible to biases and external influences. In contrast,...
Statistical Methods for Analyzing Epidemiological Data
Comparing the Survival Analysis of Two or More Groups
Steps in Outbreak Investigation
Statistical Software for Data Analysis and Clinical Trials
Data Validation
Key parameters for method validation include:
