arXiv (AI)AI
BatchDAG:エンタープライズデータに対するスケーラブルなアドホック分析のためのLLM計画実行グラフ
BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)は個別のドキュメント分析には優れていますが、エンタープライズ規模のデータセット全体にわたる包括的なクロスエンティティ分析に直面すると、コンテキストオーバーフロー、エンティティごとの属性情報の喪失、順次ツール呼び出しによる線形レイテンシなどの課題に直面します。BatchDAGは、LLMが型付き有向非環グラフ(DAG)を生成し、SQLクエリ、セマンティック検索、インメモリ変換、並列ファンアウト、シングルショット分析といった多様な操作を含む新しいシステムです。このDAGを決定論的エンジンがトポロジカル波並列処理と構造化JSONデータフローで評価することで、複雑な分析を効率的に実行します。
本研究の重要な最適化手法であるエンティティ認識バッチ処理は、ファンアウト前にエンティティごとに行をグループ化することで、LLM呼び出しを最大47倍削減します。BatchDAGは手動最適化パイプラインよりも精度を向上させるシステムではなく、むしろ複数の手作業で設計されたワークフローを、自然言語から適切な実行戦略を生成する統一されたシステムで置き換える汎用オーケストレーションレイヤーです。
トランスクリプト中心の12個のクエリを対象とした統制実験では、BatchDAGは品質スコア3.74/5を達成し、専門家設計パイプライン(3.25/5)と比較可能な結果を示し、ReAct(3.09/5)を大幅に上回りました。さらに優れた根拠追跡能力により、トランスクリプト証拠率77%を達成(ベースライン46~60%)。構造化JSONの中間表現は、散文サマリーと比べ幻覚を27%削減します。300回の計画呼び出しにおいて98.8%の有効DAG生成率を実現しており、生産環境(Brevian.ai)では50,000以上の会議に対するクエリを60秒以内に処理し、1クエリあたりのコスト0.02~0.24ドルで運用されています。