arXiv (ML)AI
エージェンティックワークフロー向けの合成メタルーティング学習:実行可能ベンチマーク
Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
エージェンティックシステムの設計において、単に最終的な回答を生成するだけでなく、その前に実行すべき推論操作と実行操作を適切に選択することは極めて重要である。従来のルーティング研究は、モデルエンドポイント、検索深度、またはツール選択のいずれかを個別に選択する傾向にあった。本研究では、この課題に対して、生のタスクテキストから異なるタイプの操作を合成する、予算対応型メタルーターと実行可能ベンチマークを提案している。
ベンチマークは、データ分析、固定コーパス研究、ドキュメント処理にわたり、訓練用216件、開発用72件、保持テスト用108件、および語彙シフト挑戦用108件のタスクで構成されている。結果はすべて操作実行後に機械的にチェックされる。研究チームは、単語と文字の特徴から操作確率を予測する正則化ロジスティック回帰ヘッドを複数個構築し、開発データで温度スケーリングを実施し、ルートコストとアクション数の予算制約の下で貪欲に合成する手法を採用した。
保持テストセットの結果、学習されたポリシーは100%の成功率を達成し、静的ワークフロー(93.5%)を上回り、コストは43%低減している。一方、単一ショット学習ルーターは56.5%の成功率にとどまった。ベンチマークの未見タスクである挑戦分割では、学習ポリシーの成功率は75.9%に低下し、静的ルーティング(93.5%)に後れを取るものの、依然として49%安価であり、単一ショットルーティングを34.3ポイント上回っている。成功率のギャップから、ルート実行ではなく語彙汎化がこの方法の主要な制限要因であることが明らかになった。本研究は再現可能なテストベッドと限定的な概念実証を確立するものであり、実運用のLLMパフォーマンスの証拠ではないことを強調しておく。