arXiv (Robotics)AI
TITLE_JA: GRACE:拡散モデルとMPPIを組み合わせた勾配フリーロボットアクション生成
GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ロボット制御において、デモンストレーションから学習した拡散ポリシーは多様なアクション列を生成できる強力な手法ですが、実際の運用環境で安全性や物理的制約を満たすよう誘導することが課題となっていました。従来の勾配ベースのガイダンス手法は微分可能なコスト関数に限定されるため、衝突判定などのバイナリ制約やジョイント角度制限、ブラックボックス型のシミュレーション評価など、微分不可能な制約に対応できないという問題がありました。
今回提案されたGRACE(Gradient-free Robot Action generation via Combined diffusion-MPPI posterior mean Estimation)は、この課題を解決する革新的なアプローチです。GRACEは事前学習済みの拡散ポリシーを、モデル予測経路積分(MPPI)制御によってガイドする手法で、勾配計算を必要とせず、フォワード評価によるコスト計算のみで制約を満たすアクションを生成します。拡散モデルとMPPIが共通のスコア上昇構造を持つという性質を活用し、逆向きステップの各段階でコスト条件付きガイダンス事後分布を構築し、拡散の逆向き平均を中心とした単一のMPPI更新により、その平均を推定するという仕組みになっています。
理論的には、微分可能なコスト関数に対してはGRACEが従来の勾配ガイダンスを一次近似の条件下で復元することが示されています。シミュレーション実験では、拡散ベースおよびサンプリングベースの従来手法を上回る成功率を実現し、実ロボット実験では7自由度マニピュレータを用いて、配置時の障害物を回避することに成功しました。従来の誘導なしポリシーがすべての試行で衝突してしまう環境で、GRACEはロバストに障害物を避けるアクションを生成できることが実証されており、実用的なロボット制御への応用が期待されます。