在急性髓性白血病的水平联合学习环境下合成表格数据生成:基于案例的模拟研究
Imanol Isasa1,2, Mikel Catalina1, Gorka Epelde1,3
1Digital Health & Biomedical Technologies Department, Vicomtech Foundation (BRTA), Donostia-San Sebastián, Spain.
JMIR medical informatics
|September 29, 2025
概括
对急性髓性白血病等罕见疾病的合成数据生成模型进行联合,可以降低数据的可靠性,但保持隐私. 增加节点数量并不会显著加剧这种权衡.
科学领域:
- 生物医学信息学 生物医学信息学
- 机器学习 机器学习
- 数据科学数据科学数据科学
背景情况:
- 数据的稀缺性和分散性阻碍了罕见疾病研究.
- 合成数据生成 (SDG) 和联合学习提供了潜在的解决方案.
- 这项研究结合了SDG和联合学习,用于急性髓性白血病 (AML) 研究.
研究的目的:
- 评估横向联合的SDG模型对隐私和忠诚度的影响.
- 将联合的SDG模型与各种数据分布和节点数量的集中基线进行比较.
主要方法:
- 在四个场景中训练了两个生成模型 (条件表格GAN,FedTabDiff):非联合的基线,均分布的联合,不均分布的联合和非iid联合.
- 在联合场景中评估了不同节点数量 (3, 5, 7, 10) 的影响.
- 评估生成的数据用于忠诚度-隐私权的权衡.
主要成果:
- 联邦导致了显著的忠诚度损失 (cGAN高达21%,FedTabDiff高达62%).
- 隐私指标在很大程度上保持不变,只有轻微的非显著变化.
- 没有观察到关于节点数量的强烈趋势,尽管存在一些显著的差异.
结论:
- 横向联合的SDG算法减少了数据保真,同时保持了隐私.
- 忠实度的恶化不会随着节点的增加而显著增加.
- 数据分区分布对评估的指标没有显著影响.


