arXiv (AI)AI
PlanFlip:マルチエージェントLLMシステムへの計画段階プロンプトインジェクション攻撃
PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
複数のAIエージェントが協力して動作するマルチエージェントLLMシステムは、目標を部分タスクに分解するプランナー、それを実行するエグゼキューター、監査するクリティックという役割分担を通じて機能します。新たな研究により、このシステムの「計画段階」が重大な脆弱性を持つことが明らかになりました。プランナーに対する単一のプロンプトインジェクション攻撃が、下流のすべての部分タスクに連鎖的に波及し、システム全体を破壊できるのです。
研究チームが提案した「PlanFlip」フレームワークは、四つの計画段階攻撃技法で構成されています。目標置換(PF-1)、優先度反転(PF-2)、文脈汚染(PF-3)、役割混乱(PF-4)です。いずれも正当なツール出力に偽装されており、キーワードフィルターを回避できます。9種類の最新LLMを対象に3,479エピソードの評価を実施した結果、衝撃的な知見が得られました。強力なモデルほど脆弱性が高まるという逆説的な現象が確認され、GPT-5では68%の攻撃成功率を記録しています。さらに、同じアーキテクチャのエージェントで構成されたシステムは「同質性の盲点」に陥り、クリティックが攻撃を検出できない事態も発生しました。
しかし希望的な発見もあります。推論強化モデルのDeepSeek-R1はすべての攻撃に耐性を示しています。研究チームが提案した防御機構「GoalAnchorCheck」と「CrossAgentConsensus」は検出率100%を達成しました。本研究の重要な結論は、マルチエージェントシステムのセキュリティには異なるモデルの多様性が必須であり、単一バックボーン内での冗長性は計画段階攻撃への防御にはならないということです。