arXiv (CV)AI
RealVDeblur:実世界のビデオ動きぶれ除去のための一段階拡散モデル
RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
動画撮影における動きぶれ(モーションブラー)の除去は、実世界での応用において極めて重要な課題です。スマートフォンでの撮影から3D再構成まで、様々な下流タスクの品質に直結するこの問題に対して、新たなアプローチが提案されました。RealVDeblurと名付けられたこの手法は、多様な撮影条件下での堅牢な映像復元を実現する効率的な生成フレームワークです。
本研究の最大の特徴は、現実的なトレーニングデータの生成にあります。3D Gaussian Splatting(3DGS)資産と高フレームレート動画を組み合わせた大規模で物理的に根拠のあるぶれ合成パイプラインを構築することで、カメラの動きに起因するぶれと物体の動きに起因するぶれの両方を含む現実的なデータセットを生成します。これにより、実世界の多様な動きパターンと複雑な劣化現象に対応することが可能になります。
復元処理には動画拡散モデル(video diffusion prior)を活用しており、フレーム間のぶれ変動に対応するために、VAEの時間圧縮を無効化し、フレームごとの符号化スキームを採用しています。実用的な導入を考慮して、多段階の拡散サンプリングを効率的な一段階生成器に蒸留し、さらに学習不要な時間窓マスク(Temporal Window Mask)により、トレーニングデータの長さを超える長時間動画の推論を一定のメモリ使用量で実現します。
複数の実世界ベンチマークでの実験を通じて、RealVDeblurは未知の動画に対して優れた知覚品質、意味的忠実度、時間的一貫性を示すだけでなく、激しい動きぶれ下での3D再構成において従来手法を上回るロバスト性を発揮することが実証されています。