arXiv (Robotics)AI
ST-WAM:視覚的分布シフト下での堅牢なロボット操作のための意味的時間的世界行動モデル
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ロボット操作タスクにおいて、環境の視覚的変化に強いAIモデルの開発が進んでいます。World Action Models(WAMs)は、ロボットの行動と将来の視覚ダイナミクスを共同でモデル化する有望なアプローチとして注目されてきました。しかし従来のWAMsはピクセルレベルの将来画像生成に依存しているため、タスクに関連しない視覚的コンテンツが行動関連の状態遷移と絡み合い、照明の変化や背景の異なりなどの視覚的分布シフト下での堅牢性が限定的でした。
研究チームが確認した「Training-Distribution Hallucination」という現象では、視覚的にシフトした観察に基づいて予測された将来フレームが、実際のシーンの状態ではなく訓練時のドメイン内容を幻覚してしまいます。診断実験の結果、DINOv3特徴量がWan-VAEレイテントよりも視覚シフト全体でより安定しており、タスク状態の区別をより良く保持することが判明しました。
新提案のSemantic-Temporal WAM(ST-WAM)は、将来予測と履歴検索の共有セマンティック表現としてDINOv3を使用しながら、細粒度のVAEダイナミクスを保持することで、行動の堅牢性を向上させます。Dual-Space Future Experts(DSFE)が将来のVAEレイテントとDINO特徴量を共同予測し、Current-Anchored Intent Retrieval(CAIR)が現在の視覚言語コンテキスト下で最近のDINO履歴から関連するタスク証拠を検索します。
ST-WAMは追加の具現化事前学習やタスク固有のアノテーションなしでエンドツーエンド学習され、推論時に明示的な将来生成を必要としません。LIBEROで98.7%、RoboTwin 2.0で92.8%の性能を達成し、より重要なことに、Fast-WAMと比較してゼロショットLIBERO-Plus性能を21.3ポイント向上させ、視覚シフト下の実世界での成功率を25.8%から61.5%へ2倍以上に改善しました。これらの結果は、意味的時間的モデリングがピクセル生成ダイナミクスを補完し、堅牢な操作を実現することを実証しています。