CTAB-GAN+:增强表格式数据合成
Zilong Zhao1,2, Aditya Kunar1, Robert Birke3
1Faculty of Electrical Engineering, Mathematics and Computer Science, Delft University of Technology, Delft, Netherlands.
Frontiers in big data
|January 23, 2024
概括
CTAB-GAN+使用条件生成对抗网络 (GAN) 生成保护隐私的合成表格数据. 这种新的方法将数据的实用性提高了21.9%以上,同时保持了严格的隐私保障.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 数据科学数据科学数据科学
背景情况:
- 由于隐私问题和数据增强需求,合成数据生成至关重要.
- 生成对抗网络 (GAN) 是创建合成数据的先进模型,但与真实数据相似度增加会增加隐私风险.
- 不同隐私 (DP) 提供隐私保证,但往往会损害数据的实用性,从而造成权衡挑战.
研究的目的:
- 推出CTAB-GAN+,一种新的条件表格式GAN,旨在提高合成数据实用性和隐私保护.
- 解决现有的GAN在数据实用性,培训融合,变量编码和隐私保证方面的局限性.
主要方法:
- CTAB-GAN+将下游损失纳入归类和回归任务中的增强实用性.
- 利用瓦瑟斯坦损失与梯度处罚来提高训练稳定性和趋同.
- 引入用于混合,不平衡或倾斜数据类型的新型编码器.
- 采用差分隐私 (DP) 随机梯度下降,以实现强大的隐私执法.
主要成果:
- 与最先进的表格式GAN相比,CTAB-GAN+在统计相似性和机器学习实用性方面表现出更高的性能.
- 在各种数据集和任务中实现至少21.9%的机器学习实用性 (F1-Score) 增加.
- 在没有显著的实用性降低的情况下成功合成保护隐私的数据.
结论:
- 在合成表格式数据生成中,CTAB-GAN+有效地平衡了数据实用性和隐私保护.
- 提出的方法比现有的基于GAN的合成器提供了显著的改进.
- 在机器学习中,CTAB-GAN+代表了保护隐私的合成数据生成的有希望的进步.


