TabGraphSyn:グラフ誘導型潜在拡散による高忠実度・プライバシー配慮型臨床データ生成
Zongqian Wu1, Huiping Chen2, Jake Y Chen1
1Systems Pharmacology AI Research Center (SPARC), Department of Biomedical Informatics and Data Science, The University of Alabama at Birmingham, AL, USA.
medRxiv : the preprint server for health sciences
|January 8, 2026
まとめ
TabGraphSynは、近傍構造を維持することにより、高忠実度の合成患者データを生成し、既存モデルの限界を克服します。この新しいアプローチは、プライバシーを確保しながら臨床研究のためのデータユーティリティを向上させます。
科学分野:
- 計算生物学
- データサイエンス
- 医療情報学
背景:
- アクセス可能な患者データは臨床研究に不可欠ですが、プライバシーと希少性の課題に直面しています。
- GANや拡散モデルなどの既存の合成データ手法は、複雑なデータ構造を捉える上で限界があります。
研究 の 目的:
- 高忠実度の合成患者データを生成するための新しいフレームワークであるTabGraphSynを導入すること。
- 患者の類似性と近傍構造を組み込むことにより、現在の生成モデルの限界に対処すること。
主な方法:
- TabGraphSynは、2段階の生成フレームワークを使用します。
- 局所的なデータジオメトリを捉えるために、患者類似性グラフ(k-NN)を構築します。
- グラフからのリレーショナル埋め込みが、合成のための潜在拡散モデルをガイドします。
主要な成果:
- TabGraphSynは、ベースラインと比較して臨床データセット(TCGA、AIDS、WBCD)で優れたパフォーマンスを示しました。
- 周辺分布誤差(最大3.5%)とペアワイズ相関誤差(最大2.61%)の削減を達成しました。
- 合成データは、分類(AUC 99.38%)および生存分析(F1スコア0.857)において高い有用性を示し、堅牢な匿名化を実現しました。
結論:
- TabGraphSynは、近傍構造を統合することにより、高忠実度の合成臨床データを効果的に生成します。
- GNNモジュールは、データ忠実度と有用性の向上に不可欠です。
- この手法により、臨床研究のための大規模コホート合成と堅牢な匿名化が可能になります。


