arXiv (CV)AI
Axolotl3D:忠実な3D形状補完のための統一フレームワーク
Axolotl3D: a Unified Framework for Faithful 3D Shape Completion
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
近年の3D生成モデルは、大規模な事前学習と拡散アーキテクチャを活用して、単一の画像から高品質な幾何学的形状を生成することに成功しています。しかし、こうしたモデルの多くは完全な可視性と単一視点の入力を前提としているため、複数視点からの観察、物体の遮蔽、あるいはモデルの編集といったシナリオでの応用が制限されていました。先行研究ではこれらの課題に個別に対処してきましたが、多様な条件信号の下で制御可能な3D補完を実現する統一的なフレームワークは存在していませんでした。
Axolotl3Dは、画像、可視性マスク、カメラパラメータ、および部分的なポイントクラウドを同時に条件として活用する、マルチモーダルで遮蔽認識機能を備えた3D生成モデルです。ポイントクラウドは幾何学的なアンカーとして機能し、忠実な形状補完を促進します。一方、カメラパラメータは共有された3D座標系における一貫性のある複数視点配置を保証します。大規模な3Dデータから多様な条件設定を合成する統一的な訓練戦略により、ロバストなクロスモーダル推論が可能となります。
Toys4KおよびOmniObject3Dデータセット上での実験では、クリーンな環境と遮蔽がある環境の両方で最先端のパフォーマンスを達成しています。さらに、実世界の再構成と幾何学的に一貫性のある編集においても強い成果を示しており、3D視覚タスクの実用的な応用拡大に向けた重要な進展となるものと期待されます。