arXiv (CV)AI
AI生成動画検出のための動画バックボーン活性化:パッチ速度プロファイリングによる新手法
Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
AI生成動画(AIGV)の検出は、現在のコンピュータビジョン分野における重要な課題となっています。AI生成動画には通常、個別のフレーム内の問題というより、フレーム間の矛盾から生じる微妙な時間的アーティファクトが含まれています。このような特性を考えると、画像のみを学習した従来のバックボーンよりも、動画学習済みのバックボーンを使用する方が検出に有利なはずです。
しかし実際には、標準的なグローバル読み出し機構を備えた動画バックボーンが、既存のベンチマークでは強力な画像ベースの手法に劣るケースが多く見られています。研究者たちはこの性能差の原因を、読み出し層における過度な時空間集約にあると特定しました。動画学習済みバックボーンは通常、各フレームを単一のグローバル記述子に圧縮するため、局所的なパッチレベルの時間的ダイナミクスが抑制され、パッチ間の関係性が失われてしまいます。これらの情報は、正確なAIGV検出に最も重要な手がかりなのです。
この問題を解決するために、研究者らは速度ゲート付きパッチ速度プロファイリング(V-PVP)という軽量な読み出し層を提案しました。この手法は集約層をパッチ速度場上の2つの並列ストリームに置き換え、約0.5Mの訓練可能パラメータを追加するだけで実現されます。V-PVPは汎用のプラグ・アンド・プレイモジュールとして機能し、エンドツーエンドの微調整とリニアプローブの両方の設定において、様々な動画バックボーンの性能を一貫して向上させます。
本手法はAIGVDBenchで95.28のAUCを達成し、バックボーンを完全に凍結した状態でこの性能を実現しています。これは、読み出し層の単純な置き換えだけで、凍結された動画バックボーンの時間的ポテンシャルを再活性化でき、AIGV検出における従来の利点を回復できることを示しています。