用人工智能驱动的合成数据生成以加速肝病学研究:对联合器官共享网络 (UNOS) 数据库的研究
Joseph C Ahn1, Yung-Kyun Noh2, Mingzhao Hu3
1Division of Gastroenterology and Hepatology, Mayo Clinic, Rochester, MN, USA.
Hepatology (Baltimore, Md.)
|March 11, 2025
概括
扩散模型创建现实的合成肝移植数据,保持临床准确性和患者隐私. 这种人工智能方法克服了肝病学研究中的数据限制.
科学领域:
- 肝病学 肝病学是一种肝病学.
- 人工智能的人工智能
- 数据科学数据科学数据科学
背景情况:
- 临床肝病学研究受到有限的数据,少数群体的代表性不足和复杂的数据共享法规的阻碍.
- 合成数据,即人工生成的患者记录,为这些挑战提供了潜在的解决方案.
- 扩散模型是一种最先进的生成技术,研究了它们创造合成肝脏移植等候名单数据的能力.
研究的目的:
- 使用扩散模型生成合成肝移植等候名单数据.
- 评估合成数据的统计准确性,临床实用性和隐私保护.
- 为了确定合成数据是否可以从UNOS数据库中复制真实世界的分布,临床相关性和生存模式.
主要方法:
- 使用扩散模型,从联合器官共享网络 (UNOS) 肝移植等候名单数据库 (2019-2023) 中生成合成患者队列.
- 使用最大平均差异 (MMD) 和瓦瑟斯坦距离,以及相关性和变量级分析来评估统计准确性.
- 通过比较无移植生存率 (卡普兰-梅尔曲线) 和MELD得分表现来评估临床效用;使用距离到最近记录 (DCR) 来量化隐私.
主要成果:
- 合成数据集与原来的UNOS数据密切相似 (MMD=0.002,标准化的瓦瑟斯坦距离<1.0).
- 保持了临床相关的相关性和生存模式,具有相似的中位生存时间和5年生存率.
- 90天死亡率预测的MELD得分表现保持一致 (原始AUC=0.839与合成AUC=0.844),隐私指标证实没有可识别的患者匹配.
结论:
- 使用扩散模型生成的人工智能合成数据可以准确地复制复杂的肝病学数据集.
- 合成数据保持了关键的临床信号和强大的隐私保护措施.
- 这种方法可以减轻数据稀缺性,提高模型通用性,促进合作,加快肝病学研究.


