arXiv (Robotics)AI
Real2Sim2Realパイプライン:ビジョン言語アクション操作のためのAMD ROCm統合プラットフォーム
Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
物理AIは、大規模なビジョン言語アクション(VLA)モデルを実世界で行動する具体化されたエージェントと統合する技術として、AI業界の次の大きなフロンティアとして認識されています。Nvidiaのジェンセン・ファンCEOは「次の大きなものはボディを持つPhysical AIだ」と述べ、AMDのリサ・スーCEOも「AIが現実世界に入り込む時代がやってきた」とコメントするなど、業界を代表する指導者たちがこの分野の重要性を強調しています。
本論文は、具体化されたロボット操作のための完全にAMDで加速されたエンドツーエンドの技術スタックを提示しています。このスタックはデータセンター向け学習用シリコン、Radeon PRO シミュレーション・レンダリングGPU、Ryzen AI エッジコンピュートを統合し、オープンソースのROCmソフトウェアスタックで統一されています。VLAベースの操作ポリシーの学習と展開にはCUDAロックされたエコシステムが必要でないことを実証しています。
四つの段階的な実証が行われます。まず、SmolVLAで訓練されたシミュレーション・トゥ・リアルの操作パイプラインが物理的なFrankaロボットアームに展開されます。次に、三つのオブジェクトから一つを選ぶセマンティック言語グラウンディングタスクが実施されます。続いて、3D ガウシアン スプラッティング(3DGS)による実シーンの再構成とGenesisフィジックスエンジンを融合させたReal2Sim合成データ生成パイプラインが構築されます。最後に、四脚歩行ロボットとヒューマノイドロボットの運動制御のための大規模強化学習が複数のハードウェアプラットフォームで評価されます。
すべてのパイプラインはRDNA4(Radeon AI PRO R9700)およびRDNA3.5(Radeon PRO W7900)ハードウェア上でROCm + PyTorchでネイティブに実行され、無料のRadeon Cloud Platformで再現可能です。