arXiv (Robotics)AI
ロボット動作学習のための順序付きアクショントークン
Ordered Action Tokens for Visuomotor Policy Learning
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ロボットの視覚運動政策学習において、連続的な動作を離散的なトークンに変換するアクション・トークン化は、現代的なAIシステムの重要なインターフェースとなっています。従来の手法には大きな課題がありました。解析的離散化手法は実用的でないほど長いトークン列を生成し、一方で学習された潜在トークン化器は構造を欠いており、下流の政策との互換性が限定されていました。
本研究は、効率的なアクション・トークン化に必要とされる三つの要件を特定しました。それは高い圧縮率、完全なデコード可能性、そして順序付きトークン空間です。これらすべての要件を満たす新しい手法として「順序付きアクション・トークン化(OAT)」を提案しています。OATは、トランスフォーマーとレジスタ、有限スカラー量子化、順序誘導訓練機構を組み合わせることで、動作チャンクを順序付きトークン列に離散化します。各トークン接頭辞が有効な動作チャンクにデコードされるように訓練することで、粗い制御情報を初期トークンに配置し、後続トークンで残差詳細を洗練させ、推論コストと動作精度の間でいつでもトレードオフを実現させます。
OATはアクショントークンの二つの主要な利用法で検証されました。自動回帰的政策として制御用トークンを生成する方法と、トークン損失を使用してビジョン言語モデルコンテキストを形成するトークン共訓練政策です。三つの政策バックボーンと五つのシミュレーションベンチマーク及び実世界設定にわたる60以上のタスクを通じて、OATは一貫して強力な政策性能を提供しながら、推論時に大きな柔軟性を提供することが確認されました。