arXiv (AI)AI
TITLE_JA: FinPerMA:金融助言向けLLMエージェントの個人化メモリベンチマーク
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)エージェントは金融助言などの高リスク領域でパーソナライズされたアシスタントとして活用されるようになってきました。しかし、長期にわたってユーザーの個人モデルを維持・更新できるかどうかはまだ明確ではありません。既存のパーソナライズメモリベンチマークは主に事実の保持能力をテストするか、モデルが生成した軌跡に依存しており、イベント駆動型の選好適応はほとんど探究されていないのが実情です。
この課題に対応するため、研究チームはFinPerMAという新しいベンチマークを開発しました。このベンチマークは、凍結された長期的な投資家の軌跡に対してパーソナライズメモリを評価します。生成パイプラインは理論に基づいた決定論的な影響ルール、制御されたLLMのナレーション、自動品質スクリーニングを組み合わせています。特に「Post-Shockチェックポイント」により、エージェントが重大なイベントを永続的なユーザーモデルに統合したかどうかを分離して検証できる設計になっています。
276のペルソナから得られた2,994個の質問に対する評価では、7つの最先端LLMと最大7つのメモリ構成が試験されました。その結果、全文脈構成であっても全体精度約0.47、複数選択肢形式で約39%を超えるものはなく、いずれもまだ飽和状態から遠いことが判明しました。属性分析からは、サマリーベースのメモリが事実の詳細は保持する傾向があるものの、パーソナライズに必要な選好シグナルを失いやすいことが明らかになっています。そのため、単純な検索機能が目的特化型メモリシステムより優れた性能を発揮することもあり、特にショック後はその差が広がる傾向が観察されました。