合成数据可以在慢性尿疹研究中允许更小的样本大小吗?
Annika Gutsche1,2, Pascale Salameh1,2,3,4,5,6, Samad S Jahandideh7
1Institute of Allergology, Charité-Universitätsmedizin Berlin, Corporate Member of Freie Universität Berlin and Humboldt-Universität zu Berlin, Berlin, Germany.
Clinical and translational allergy
|August 7, 2025
概括
合成数据生成准确地反映了慢性自发性疹 (CSU) 患者的真实数据,即使样本大小较小. 这种方法通过包括代表性不足的患者群体来加强临床和流行病学研究.
科学领域:
- 医疗信息学 医疗信息学
- 生物统计学 生物统计学
- 流行病学 流行病学
背景情况:
- 慢性自发性疹 (CSU) 研究受限于临床试验和观察研究中老年人和并发病患者的代表性不足.
- 严格的试验标准和小样本大小阻碍了可靠的数据分析和统计能力.
- 生成合成患者数据可以通过反映不同的临床特征来克服这些局限性.
研究的目的:
- 开发和验证一种用于生成慢性自发性疹 (CSU) 的合成患者数据的方法.
- 评估合成数据在复制真实世界数据 (RWD) 特性和关联方面的准确性.
- 为了确定高质量的合成数据生成所需的最小样本大小.
主要方法:
- 采用基于树的决策模型,从慢性疹注册表 (CURE) 的现有RWD中生成合成数据.
- 通过分析描述性特征和RWD与合成数据之间的变量关联来评估复制的准确性.
- 确定了维持高合成数据准确性的最低样本大小值.
主要成果:
- 合成数据与患者的人口统计和RWD的临床特征密切相匹配.
- 小组复制和分布与RWD一致,在疾病特异性因素和风险因素上没有显著差异 (p > 0.05).
- 只有25%的原始RWD才能实现高精度合成数据生成,从而使人口增加了四倍.
结论:
- 合成数据可以准确地复制CSU患者的RWD,即使原始人群规模减少.
- 这种方法为在临床和流行病学研究中增加小患者亚组提供了可行的解决方案.
- 合成数据生成具有很大的潜力,可以在代表性不足的人群中推进研究.


