arXiv (ML)AI
分散GPU推論における トポロジー認識データ移動の最適化
Topology-Aware Data Movement for Disaggregated GPU Inference
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の推論を複数のGPUプール間で分散実行する際、新たなネットワーク課題が生じている。プリフィル(prefill)とデコード(decode)を異なるGPUプール上で実行する場合、KVキャッシュを両者間で転送する必要があり、70Bモデルでは1リクエストあたり2.6GBという膨大なデータ量になる。本論文が指摘する問題は、既存システムのDistServe、Splitwise、Mooncakeといったソリューションが、均一なRDMA(Remote Direct Memory Access)を採用し、GPU間の物理的位置関係による帯域幅の大きな差異を無視しているという点である。
実際のデータセンターにおいて、GPU間の帯域幅は物理的関係により最大72倍の差が生じる。NVLink経由での同一ドメイン内通信は900GB/sに達する一方、InfiniBand経由のノード間通信は50GB/s、TCP経由のデータセンター間通信は12.5GB/sに留まる。本論文では、この階層的なネットワークトポロジーを認識し、各転送に最適なプロトコルを動的に選択するシステムを提案している。
提案手法は3つの主要メカニズムで構成される。第一に、レイヤーごとの段階的転送によってプリフィル処理と通信をオーバーラップさせ、潜延時間の60~85パーセントを計算の背後に隠蔽する。第二に、Mixture-of-Experts(MoE)モデルにおいてNVLinkドメイン対応のプレースメント最適化を行い、エキスパートディスパッチとKVキャッシュの局所性を協調最適化する。第三に、CXL 3.0メモリエクスパンダーを共有オーバーフロー層として活用し、NVMeよりも86倍低い遅延で6倍の容量を提供する。
評価結果の投影分析によれば、提案システムは3つのアーキテクチャ構成において均一RDMAと比較して3~18倍の転送遅延削減を達成する見込みである。