arXiv (Robotics)AI
TITLE_JA: WCM:人間ロボット相互作用の汎用化を実現する世界認知モデル
WCM: World-Cognition Model for Generalizable Human-Robot Interaction
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ソフトウェア環境での言語エージェントは既に流暢なユーザー対話を実現していますが、ロボットが物理的なタスクで同等レベルの相互作用をもたらすことは依然として困難な課題となっています。ビジョン言語行動ポリシーやワールドモデルベースのプランナーといった現在のロボット制御パラダイムは、主に指示実行に最適化されており、ユーザーがロボットなぜそのアクションを選択したのかを理解する可視性に乏しく、相互作用を通じてロボットにリダイレクト、修正、教示するメカニズムがほとんど用意されていません。
この問題を解決するために、研究チームはWorld-Cognition Model(WCM)を提案しました。WCMは、Sensing(センシング)、Logic(論理)、Action(行動)、Knowledge(知識)から構成されるSLAKアーキテクチャと非同期ランタイムに基づいた人間中心の具現化エージェントです。SLAKアーキテクチャは知覚、推論、制御、メモリを分離することで、ランタイムは推論、対話、実行を並行して処理することを可能にします。
WCMはさらに、ユーザーが対話的にロボットに困難なタスクや長期的なタスクを教示できるヒューマン・イン・ザ・ループ教示モードを導入しています。教示エピソードと自律的なタスク実行は、Chain-of-Thoughtスーパーバイザンスに精製され、モデルの継続的な改善に活用されます。実験結果として、WCMはCoT微調整から外れたタスクや教示を通じて学習した長期タスクを含む、9つの実世界の人間ロボット相互作用タスクで平均73.8%の成功率を達成しています。