arXiv (CV)AI
Mage-VL:効率的なコーデック対応ストリーミングマルチモーダル基盤モデル
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
標準的なビジョン言語モデル(VLM)は、複雑なオフライン視覚推論には優れている一方で、シンプルなストリーミング知覚タスクでは効率的に処理できないというモラベックのパラドックスに直面しています。新たに発表されたMage-VLは、リアルタイムマルチモーダル理解と相互作用を実現する効率的なコーデック対応ストリーミング基盤モデルです。このモデルの中核をなすのは、カスタムトークナイザーであるMage-ViTで、均一なフレームサンプリングの代わりに、動きベクトルと残差エネルギーを使用して、スパースなアンカー(I)フレームと予測(P)フレーム全体の動的かつエントロピー豊富な領域を選別してエンコードします。16×16パッチレベルで動作することで、視覚トークンの消費を75%以上削減しながら、時空間コンテキストを保持しています。
Mage-ViTは約5億6000万の未ラベル画像と1億の未ラベル動画フレームでゼロから学習され、数十億の画像テキストペアで学習された最先端のエンコーダーと同等かそれ以上の性能を実現しています。さらに同研究では、マルチモーダルキャプショニング用のプロンプト・コード共同最適化とAI駆動型パフォーマンス診断を含むAI4AIデータパイプラインを確立し、学習レシピを指導しています。
Mage-VLはまた、軽量なSystem 1イベントゲートと因果的なSystem 2デコーダーという生物学的インスピレーションを得た双対システムアーキテクチャを通じて、能動的なストリーミング知覚を実現します。広範な評価結果では、Mage-VL-4Bは静的タスクでは同サイズのQwen3-VL-4Bと同等の性能を示しながら、ビデオ理解と2D/3D空間推論で大幅な改善を達成し、推論速度は最大3.5倍の高速化を実現しています。さらに15BパラメータのPhi-4-reasoning-visionを圧倒する総合的な性能向上も確認されており、事前学習データ効率や可変解像度スケーリングなど7つの重要な実証的知見が報告されています。