arXiv (Robotics)AI
TITLE_JA: 具現化エージェントが制御を担う:最小限のインターフェースでゼロショット学習エージェントが産業規模のポリシーに匹敵する性能を実現
Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
自律的な具現化エージェント(embodied agent)は、知覚、行動、検証、自己修正という長期にわたる意思決定ループを維持する必要があります。従来のシステムはタスク固有のワークフローや学習済みポリシーを通じてこのループを維持してきましたが、本研究では第三の形態である「エージェント的具現化制御」を探求しています。ここでは汎用エージェントがループ自体を保持する仕組みを採用しています。
研究チームはゼロショット・ナビゲーション(事前学習なしでの環境ナビゲーション)を実験の場として、単眼RGBカメラと離散的な行動のみという厳密に最小限の条件下で、3つのソフトウェア工学系エージェント基盤を評価しました。デフォルト設定では70.7%±3.5%の成功率を達成し(Claude Opus使用時、3回の平均)、最大努力時にはfable-5が78%に達しました。さらに学習済みウェイポイントツールをオプション機能として追加した場合、ハイブリッドなfable-5エージェントはデフォルト努力時に76.7%±0.6%の成功率を達成しながら、環境ステップは半減し、処理時間は4分の1以下に削減されました。
制御介入実験を通じた分析結果から、性能はモデルの選択に大きく左右されることが明らかになりました。モデルの変更によって成功率が大きく変動する一方、エージェント基盤の効果は相対的に限定的で、ウェイポイント・インターフェースはより弱いモデルには有効ですが、強力なモデルでは性能を低下させる可能性があります。ただし、より長期的なタスクではパフォーマンスが急激に低下し、レイテンシとコンテキストの増大が持続的な運用を制限する課題が残されています。本研究は、エージェント的制御がすでにゼロショット・ナビゲーションで産業規模のポリシーと競争力を有すること、またモデル選択、基盤設計、インターフェース設計が自律的な具現化エージェント実現への補完的なアプローチを提供することを示唆しています。