arXiv (Robotics)AI
リスク認識を考慮した確率的結果に対する人間の選好学習
Risk-Aware Preference Learning for Stochastic Outcomes
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
ロボットの行動を人間の期待に合わせるため、人間の選好から報酬関数を学習する手法は広く用いられています。しかし従来のアプローチの多くは、人間が期待効用理論(EU)に基づいて不確実な結果を評価すると仮定しており、結果の効用をその確率と線形に組み合わせています。これに対して、行動経済学の研究では、人間は実際にはリスク敏感であり、稀な負の事象を過度に重視し、損失回避傾向を示すことが明らかになっています。
本研究は、社会的ロボットのナビゲーション場面において、この理論と実際のズレがもたらす影響を調査しています。特に衝突などの安全性に関わる結果は稀ですが極めて重大な結果として扱われます。研究チームは期待効用理論と、人間の意思決定の非線形モデルである累積プロスペクト理論(CPT)をBradley-Terry選好学習フレームワーク内で比較しました。
予備実験の結果、リスク敏感な人間が生成した選好に対しては、CPTベースの学習者が期待効用ベースの学習者と比べて、著しく低い後悔度で報酬関数を復元できることが示されました。この発見は、確率的なロボット行動の結果に対する選好から報酬を学習する際に、人間のリスク感応性をモデル化することの重要性を強調しています。