arXiv (NLP)AI
経験から学習する状態依存的予測知識の獲得
Learning Stateful Predictive Knowledge From Experience
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)がエージェントとして経験から学習する際、従来は軌跡レベルの反省に依存してきました。しかし、予測知識の観点から見ると、このアプローチは事後的な後付けの説明に基づいており、経路に依存した脆弱なヒューリスティクスしか生み出していません。本研究は、この問題に対処するため、状態依存的知識学習(SKL)を提案しています。
SKLは、軌跡レベルの要約からエージェントのフォーカスをシフトさせ、状態に固定された明示的で宣言的な予測評価を維持する状態依存的知識の保持へと向かわせます。研究チームはまず、状態依存的知識がいかに細粒度性を提供し、汎化を強化し、知識のブートストラップを可能にするかを示す動機づけの例を提示しました。このアイデアをさらに拡大するため、自己蒸留(SKL-SD)と強化学習(SKL-RL)という2つのアルゴリズムを導入し、エージェントが経験から状態に根ざした予測知識を自律的に抽出し、政策決定でそれを活用することを学ぶようにトレーニングします。
WebShopやScienceWorldなどのインタラクティブ環境、複雑な推論タスク(チェスパズル)での実験結果は、状態依存的予測知識を学習する固有の能力をモデルに持たせることで、従来の反省ベースの訓練パラダイムを大きく上回るパフォーマンスが得られることを実証しています。この研究は、LLMエージェントが環境との相互作用を通じてより堅牢で汎用的な知識を構築するための新しい道を開くものとして期待されます。