arXiv (Robotics)AI
シャオミが10万時間以上の実世界データで訓練した汎用ロボット基盤モデル「Xiaomi-Robotics-1」を発表
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
シャオミが発表した「Xiaomi-Robotics-1」は、ビジョン・ランゲージ・アクション(VLA)モデルという新しいタイプの汎用ロボット基盤モデルです。このモデルは、自然言語の指示に従って、見たことのない環境で多様なモバイルマニピュレーション(移動型ロボットアーム)タスクを実行できるほか、最小限のファインチューニングデータで新しいタスクに効率的に適応できるという2つの優れた特性を備えています。
開発チームは2段階の訓練レシピを採用しました。第1段階の事前訓練では、UMIデバイスを通じて収集した10万時間以上の実世界操作軌跡データを使用し、モデルに広範で汎化可能なアクション生成能力を付与しています。特筆すべき点として、軌跡クリップを自動でアノテーション(自動ラベリング)するスケーラブルなパイプラインを開発し、シーン状態の遷移を説明する自然言語で豊かで正確な条件付けを実現しました。第2段階の後訓練では、これらの能力をロボット実体と人間が自然に使用する命令形式に調整します。
実験結果は優れたスケーリング挙動を実証しています。事前訓練中にデータスケールとモデルサイズが増加するにつれて、Xiaomi-Robotics-1は一貫して性能が向上し、この改善は後訓練にも直接転移されます。複数のシミュレーションベンチマークではRoboCasa365で57.6%の成功率を達成し、従来の最高記録46.6%を超えています。RoboDjoでは平均スコア20.07を記録し、先行技術の13.07を大きく上回っています。このモデルは複雑な器用さを要するタスクへの高いデータ効率でのファインチューニングにも対応でき、強固なロボット基盤ポリシーとして機能します。