arXiv (ML)AI
TITLE_JA: MetaRoute-Bench:エージェント型ワークフローのルーティング決定ポリシー評価フレームワーク
MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
AIシステムが複雑なタスクを処理する際、直接回答するか、タスクを分解するか、ツールを呼び出すか、コードを実行するか、専門家に委譲するか、中間結果を検証するか、あるいは失敗から復旧するかといった意思決定を繰り返す必要があります。こうしたメタ決定はタスクの成功率だけでなく、運用コストとレイテンシにも大きく影響しますが、これまではオーケストレーションフレームワークに埋め込まれたままで、タスク精度といった集計指標でしか評価されてきませんでした。
今回発表されたMetaRoute-Benchは、共通の実行モデル下でメタ決定ポリシーを比較するためのオープンで検査可能な評価フレームワークです。初期ベンチマークはデータ分析、研究、文書処理にわたる180の合成タスクプロファイル、8つのルーティングポリシー、30組のペアランダムシードで構成されており、43,200のトレースを通じて評価が実施されました。
結果によると、タスク認識型の組成ポリシーは79.4%の成功率を達成し、強力なワークロード特有の静的ポリシーの76.7%、ワンショットタスクルーティングの67.4%、直接回答の52.9%を上回りました。静的ポリシーと比較して2.7パーセンテージポイントの改善が見られ、95%信頼区間は±2.0ポイント、平均コストは4.7%上昇、レイテンシは6.4%上昇しています。消去試験では、ルート組成が単一操作に制限されるか検証が削除される場合に最大の損失が生じることが明らかになりました。
これらの結果はライブデプロイメントではなくシード付きのオフライン実行モデルによって生成されているため、本研究の主な貢献は再現可能な評価手法とルーティングポリシーのトレードオフ分析であり、本番環境での有効性の証拠ではありません。開発チームはタスク生成、ポリシー、トレース、テスト、分析成果物をリリースして、実際のシステム検証を支援しています。