arXiv (CV)AI
MegaSlide-DiT:メモリ効率を重視した適応とデフォーマブル局所注意による高速ビデオ拡散モデル
MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
高解像度のビデオ生成において、拡散トランスフォーマー(DiT)に基づいたモデルは優れた品質を実現する一方で、単一のワークステーションのメモリ予算をすぐに超過してしまう課題があります。100億パラメータを超えるDiTモデルは1テラバイト以上の永続的な状態を必要とし、従来の時空間自己注意は系列長に対して二次関数的に増加してしまいます。このパラメータメモリと活性化メモリという2つの壁により、研究者たちは大規模なGPUクラスタなしに大規模な生成モデルの適応が困難でした。
本研究ではこの問題をシステムズパースペクティブから再検討し、MegaSlide-DiTを提案しました。このプロトタイプは事前学習済みの105BパラメータのDiTモデルを、単一のH200 GPUと1.5TBのホストRAMで適応させることが可能であることを実証しています。核となる知見は、GPUがモデル状態全体を保有する必要がないということです。すべての永続的なウェイト、マスターウェイト、オプティマイザのモーメントはホストメモリに留まり、必要に応じて一時的なシャードのみがGPUにストリーミングされます。
同時に、研究者たちは二次関数的なグローバル注意を、3次元デフォーマブルスライド注意(3D-DSA)に置き換えました。この運動適応的な局所注意演算子は、メモリと計算複雑性を系列長に対して線形に削減します。詳細なメモリ会計、実行トレース、評価結果により、このデザインの有効性が検証されています。
MegaSlide-DiTは単一GPU上での105Bモデルの完全な学習を目指すものではなく、帯域幅の限界を魔法のように解決するものでもありませんが、高性能ワークステーション上で大規模ビデオ拡散モデルの全パラメータ適応を実現する実用的な道筋を提供しています。