arXiv (Robotics)AI
単一ラウンドでの修正可能な支援:実用的-教育的最適応答
Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
人間とロボットの協働作業における意思疎通は、情報の非対称性から生じる課題を抱えています。人間は目標を明確に知っていますが、ロボットはそれを観察と相互作用を通じて推測する必要があります。このような状況を扱う支援ゲーム理論では、ロボットが人間の意図を正確に理解してから支援を開始することが理想的です。
従来のアプローチでは、最適な支援戦略を求めるために部分観測マルコフ決定過程(POMDP)での計画が必要とされており、計算コストが膨大になることが問題でした。本研究では、実用的-教育的推論(pragmatic-pedagogic reasoning)を活用することで、目標の不確実性が単一の時間ステップで解決される支援ゲームのクラスを特定しました。このアプローチにより、全体のゲーム進行を計算量的に扱いやすい最適応答手続きで正確に解くことが可能になります。
従来の逆最適制御(inverse optimal control)では、タスク実行だけでは区別できない複数の目標候補に対応できないという推論の限界が存在します。一方、実用的-教育的推論は、見た目は同等でも実行結果が異なるアクションを通じて、目標を即座に明確化することでこの障壁を乗り越えます。研究チームは、ブロック積み木という単純な協調作業の例を用いて、提案手法の理論的成果と実装方法を検証しました。