arXiv (CV)AI
DVPSFormer:自動運転向け効率的なオンライン深度認識ビデオパノプティックセグメンテーション
DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
自動運転車の安全な走行には、動的な環境を包括的に理解する必要があります。特に重要なのは、メトリック深度(距離情報)の推定、意味領域のセグメンテーション、そしてインスタンスの軌跡追跡を同時に実行することです。従来のアプローチでは、これらの複雑なタスクを統合するために計算量の多い多段階パイプラインやオフライン追跡に依存しており、リアルタイム判断が必要な自動運転には不向きでした。
今回提案されたDVPSFormerは、この課題を解決する統一的なオンラインアーキテクチャです。このシステムの中核となるのは、明示的シーン離散化(ESD)と呼ばれる革新的なメカニズムです。ESDはセグメンテーションクエリを用いて前景と背景の領域を表現し、離散から連続への変換(D2C)深度ヘッドがメトリック深度を単一パスで復号化できるようにします。このアプローチにより、意味情報と幾何学的情報の学習が密結合され、処理遅延が大幅に削減されます。
さらに、DVPSFormerは時間的一貫性を活用するオンライン多数決投票(OMV)メカニズムも提案しており、インスタンス追跡中の分類精度をさらに洗練させます。このモデルはCityscapes-DVPSとSemKITTI-DVPSの両ベンチマークで最先端の性能を実現し、ロボット知覚におけるオンライン処理の効率的ソリューションとなります。