arXiv (ML)AI
投機的デコーディングにおけるMLA草案モデルの機能的再構成:KV再構成を超えて
Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
マルチヘッド潜在注意(MLA)は、増大するキー・バリュー(KV)キャッシュをコンパクトな潜在状態で置き換え、デコード時のメモリトラフィックを削減するため、長文脈のLLM推論において重要性が高まっています。しかし、最も性能の高いオープンソースのモデルチェックポイントの多くはマルチヘッドまたはグループ化クエリ注意(MHA/GQA)を使用しているため、ゼロからの再学習なしにMLAのキャッシュ効率を得るための変換が必要です。
投機的デコーディングは相補的な高速化を提供しますが、その高速化は草案提案と検証対象間の一致度に依存しています。本研究は、直接的なMHA/GQAからMLAへの変換により、この一致度が大幅に低下することを発見しました。低ランク因数分解とRoPE処理による注意関数のエラーは、単独の生成では許容可能ですが、草案トークンの受け入れを大幅に低下させます。そこで研究チームはMLA草案構成を、キャッシュ圧縮ではなく機能的再構成として定式化しました。
提案するエンドツーエンド(E2E)手法は、変換されたMLA注意モジュール各々を、キャリブレーション隠れ状態上の元のMHA/GQA対応物の出力投影後応答を再現するように最適化します。この変換器非依存の後変換手続きは、検証器ロジットや検証器の監督を必要とせず、変換済みキャッシュと推論グラフを保持します。研究では、4つのLlama/Qwen草案・対象ペア、TransMLA およびMHA2MLA、HFおよびvLLM、4つの200プロンプトタスクに渡る192のモデル・変換器・バックエンド・手法・タスク構成を評価しました。結果として、機能的再構成は64個の一致したタスクセルの37個で受け入れを大幅に改善し、26個は実質的に変わらず、1個は実質的に低下しました。