arXiv (CV)AI
より優れた、より強力で高速、そして広範に:MLLM向けセグメンテーションのための構造化全マスク予測
Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
マルチモーダル大規模言語モデル(MLLM)を用いた画像セグメンテーションは、高い分割性能、対話能力の保持、高速推論という3つの要件を同時に達成することが難しいという根本的な課題に直面していました。埋め込み予測法はピクセルレベルの目的関数を通じて言語モデリングを阻害する恐れがあり、一方で次トークン生成は密集マスクの処理が非効率でした。
これらの課題を解決するため、研究チームは自己回帰的な対話と非自己回帰的なマスク予測を分離する「All-Mask Prediction」手法を提案しました。その二値実装であるSTAMP(Simultaneous Textual All-Mask Prediction)は、語彙内トリガーを発行し、画像に整列されたマスクトークンを対応するパッチ特徴と融合させ、ハイブリッド注意機構を用いてすべてのトークンを1パスで前景または背景に分類します。これにより、強力な参照推論セグメンテーション機能とマルチモーダル能力の保持、効率的な推論が両立されます。
しかし二値マスクでは、複数の意味的またはインスタンス識別情報を保持するために繰り返された目標特定の予測が必要になるという制限がありました。そこで、より高度な「Structured All-Mask Prediction」とSTAMPlusが開発されました。STAMPlusは明示的なIDと選択的なバウンディングボックスを含む目標リストを生成し、これらのIDを共有マルチクラスマスク空間に結合し、すべての目標を1つの非自己回帰パスで同時予測します。単一の統合されたモデルで参照推論能力を保持しながら、オープン語彙セマンティックセグメンテーション、インスタンス認識セグメンテーション、リモートセンシング小目標セグメンテーションまで拡張可能です。12カテゴリの遅延時間を13.50秒から5.16秒に短縮し、最先端のセグメンテーション性能を実現しながら、マルチモーダル命令追従能力も保持しています。