arXiv (CV)AI
TITLE_JA: TraceCLIP:パッチ・トゥ・CLS寄与度から局所セマンティクスを復元する手法
TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ビジョン言語モデルであるCLIPは、大規模な対比学習により画像とテキストの共有埋め込み空間を学習し、様々なタスクの基盤となっています。しかし、従来のCLIPは画像レベルの目的関数に基づいており、テキストとグローバルな表現であるCLS(クラストークン)由来の表現を整列させるため、局所的なビジョン言語対応は間接的な制約にとどまっていました。物体検出、領域認識、オープン語彙セマンティックセグメンテーションなど、密集したビジョン言語理解を実現するには、言語概念と空間的に根拠付けられた視覚領域を関連付ける必要があります。
既存の手法の多くは、追加的な教師あり学習、外部モデル、またはタスク固有の適応を導入していました。一方、訓練不要なアプローチでは、既存のパッチ特徴から密集した応答を復元するだけで、CLIP内で局所セマンティクスがどこで最もアクセス可能になるのか検証していませんでした。
本研究で提案するTraceCLIPは、CLS注意出力に書き込まれたパッチ固有の項を分離することで、潜在的なパッチレベルのセマンティック証拠を復元する訓練不要なフレームワークです。さらに、寄与度由来のセマンティック応答をセマンティック測地線位相ゲートに変換し、密集特徴再構成のための最終層パッチ親和性を調整します。診断実験により、これらの寄与度特徴が強力な局所セマンティック判別性とテキスト条件付き空間整列を示すことが明らかになりました。
8つのゼロショットセマンティックセグメンテーションベンチマークにおいて、TraceCLIPは追加訓練、外部ビジョンファンデーションモデル、または領域レベルの教師なしで、バックボーン全体と背景設定の両方にわたって、従来の訓練不要手法よりも平均mIoUで1.3~4.5ポイントの向上を達成しました。これらの知見は、空間的に局所化されたセマンティクスが、グローバルに整列された表現の内部構築において依然としてアクセス可能であることを示唆しています。