arXiv (AI)AI
長期行動エージェントにおけるコミットメント・ドリフトとバインディング・ドリフトの分離を実現する自己検証型エージェント・インストルメント
The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
長期的な目標達成を目指すAIエージェントの開発において、エージェント自身の状態報告や内部状態を完全には信頼できない環境下で、どのようにしてそのふるまいを検証するかは重要な課題である。本研究は、事後的な検証ではなく、構造的に検証を組み込んだ新しいエージェント・インストルメント(検証装置)を提案している。
このシステムでは、決定論的なエグゼキューティブが全ての信念を保有し、言語モデルは型付きの提案のみ提出できる設計になっている。重要な特徴は、予測が行動前に事前登録され、その後の実際の観測とコード上で照合されることで、初めて主張が認められるという点である。このアプローチにより、8回の初期アーキテクチャ実行のうち4回が無効化されるなど、実装上の欠陥を直接的に特定できる。さらに、システム全体が完全なアブレーション分析を行うシャドウ・リファレンスを備えており、テスト対象のメカニズムが除去されたケースでもドリフト・メトリクスを定義できる。
研究では、長期ホライゾン・エージェントが普遍的に経験する障害について、単一変数による明確な結果を報告している。コミットメント・メカニズムを除去するとゴール・アンドンメント(目標放棄)が0.00から1.00に劇的に変化する一方、バインディング・エラーは0.00のまま変わらない。これにより、コミットメント・ドリフトとバインディング・ドリフトが異なる失敗メカニズムであることが実証された。本研究の主な貢献は、エージェント開発における検証方法論と、これを可能にするドリフト分解の測定可能化にある。