arXiv (ML)AI
タビュラーデータ生成モデルにおける列間依存性ギャップの測定と診断
Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
合成タビュラーデータ(表形式データ)の生成は、各列の周辺分布を保持するだけでなく、列間の依存関係も保存することが重要とされています。特に詐欺検知や臨床リスク評価のような不均衡データセットにおいて、少数クラスの判別に必要なシグナルの多くがこうした構造に含まれているためです。しかし本研究が明らかにしたのは、合成データの品質を認証するために一般的に使用されているメトリクスの多くが、列間の依存性に対してほぼ盲目的であるという問題です。すべての列を独立でモデル化する基準(依存性を完全に破壊する)が、ロジスティック回帰C2STでは実データと区別不可能と判定されるなど、既存の評価手法の限界が顕在化しています。
そこで研究チームは、依存性を考慮した新しい診断手法を提案しました。強力な分類器ベースの二標本検定(XGB-C2ST)を、周辺分布、依存性、数値-カテゴリ交差成分に分解するアプローチです。最先端のフロー・マッチング生成器(TabbyFlow/EF-VFM)に適用した結果、既存メトリクスが見落としていた実際の依存性ギャップが発見されました。依存性を破壊すると少数クラスの有用性が著しく低下し、生成器の残差ギャップは一貫性のある利用性コストをもたらします。
この依存性ギャップが平均場生成の構造的限界を反映しているかという検証も行われました。興味深いことに、最近の変分フロー・マッチングの回復結果と一致して、目的関数は漸近的に正確であることが判明します。しかし依存性ギャップは頑強で、モデル容量を16倍増加させても閉じられません。これは容量や構造的な制限ではなく、直接的な依存性教師信号の欠如を示唆しています。この結論を裏付けるように、在モデル依存性メカニズム、事後的なコプラ補正、そして16倍の容量増加のいずれでも、この残差ギャップを低コストで解決できないことが確認されました。この結果は、依存性の改善を簡単な介入で解決できると仮定する当該分野に対する重要な警告となります。