通过人工智能生成纵向合成数据,以加速乳腺癌的临床和翻译研究
Elena Zazzetti1, Saverio D'Amico1,2, Flavia Jacobs1,3
1Humanitas Clinical and Research Center-IRCCS, Milan, Italy.
JCO clinical cancer informatics
|November 6, 2025
概括
使用人工智能生成的合成数据 (SD) 解决了乳腺癌研究中的现实数据挑战. 这种方法增强了数据隐私,改善了预测模型,并有助于临床试验设计,以获得更好的瘤学结果.
科学领域:
- 在瘤学瘤学.
- 生物医学信息学 生物医学信息学
- 人工智能的人工智能
背景情况:
- 现实世界数据 (RWD) 对乳腺癌 (BC) 研究至关重要,但面临隐私问题,信息缺失和碎片化等局限性.
- 先进的生成模型为创建强大的纵向数据集提供了潜在的解决方案.
研究的目的:
- 探索先进的人工智能模型产生的合成数据 (SD) 的使用,以克服乳腺癌研究中的RWD限制.
- 创建协调,保护隐私的纵向数据集,以改善研究和临床应用.
主要方法:
- 利用来自i2b2平台的1052名BC患者 (HER2阳性和三阴性) 的数据集.
- 应用生成对抗网络 (GAN),变异自编码器 (VAE) 和语言模型 (LM) 来生成合成纵向数据.
- 通过使用合成验证框架 (SAFE) 对三种设置的忠实性,实用性和隐私进行SD评估:i2b2集成,疾病建模和合成控制组生成.
主要成果:
- SD展示了高保真度 (0.94分) 和确保数据隐私,与验证的时间模式.
- SD与i2b2平台的集成保护了隐私,同时反映了RWD.
- SD改善了多状态疾病进展模型的性能 (高达10%的C指数增加),并复制了合成对照臂生成的临床试验终点.
结论:
- 人工智能生成的纵向SD有效地解决了乳腺癌研究中的RWD挑战.
- 这种方法增强了翻译研究和临床试验设计,并提供了强大的隐私保护.
- 与i2b2等平台的集成显示了更广泛的瘤应用的可扩展性.


