arXiv (ML)AI
ユーザー条件下での個人用LLMエージェント評価:時間的介入への対応を測定する
Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
人工知能の進化に伴い、個人用のLLMエージェント(大規模言語モデルを基盤とするエージェント)の性能評価方法が重要な課題となっています。これらのエージェントは、ユーザーとの相互作用を通じて記憶、習得したスキル、ツール設定、ポリシー状態などを段階的に進化させていくものですが、既存のベンチマークではこうした機能をそれぞれ独立して評価する傾向がありました。ツールベンチマークは固定されたAPIの下での呼び出しテストのみ、メモリベンチマークは情報の想起や忘却の測定のみ、安全性ベンチマークは静的なポリシー遵守の確認のみといった具合です。
本研究は、個人用エージェントの評価には異なるプロトコルが必要であると主張しています。具体的には、同じ時間的介入を異なるユーザー条件下での永続状態に対して繰り返し適用し、障害がエージェント全体のコンポーネント間でどのように伝播するかを測定することが重要だとしています。この要件を4つの条件として形式化しました:明示的な時間的介入、介入全体での永続状態の保持、誘発される横断的効果、ユーザー条件下での状態のばらつきです。
公開されているベンチマークプロトコルの監査では、これら4つの条件すべてを満たすプロトコルが見つかりませんでした。この論文は個人用エージェント評価のための最小限のベンチマーク設計と候補報告メトリクスを提案し、ユーザー条件下での適応性を測定する具体的な設計要件を示しています。