arXiv (ML)AI
TITLE_JA: 階層的コピュラ-ガンベル-トップK ルーティング:固定ルーティング法則でのフローズン混合専門家モデルにおける双方向依存制御
Hierarchical Copula-Gumbel-Top-\texorpdfstring{$K$}{K} Routing: Two-Sided Dependence Control for Frozen Mixture-of-Experts at Fixed Per-Token Routing Laws
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
機械学習における大規模言語モデルの効率性を高めるため、混合専門家(MoE)アーキテクチャが注目を集めています。本研究は、このMoEモデルにおけるトークンのルーティング機構に新たなアプローチを提案しています。
従来のGumbel-Top-Kルーターは、各トークンに対して独立したルーティング決定を行い、専門家の選択と混合重みを決定しています。しかし本論文が問い直すのは、個々のトークンのルーティング法則を完全に固定しつつ、異なるトークン間の結合分布をコントロールできるかという点です。提案された「階層的コピュラ-ガンベル-トップK」(HCG-TopK)手法は、この課題に対する解決策を提示します。
この手法では、関連するトークンのグループ内において交換可能なガウシアンコピュラを用いて、各専門家座標でのガンベル摂動に正の相関を導入し、グループ内での専門家セットの一貫性を高めます。一方、異なるグループ間では調整可能な反対相関構造を組み込むことで、負の依存性を選択的に導入します。重要なのは、これらの操作がトークンのTop-Kサンプル、混合重みの分布、および包含確率を保持したまま、専門家への負荷分散を制御できることです。正の相関によるグループ内結合は専門家負荷の分散を増加させ、グループ間の反対相関はそれを減少させるという補完的な関係が成立します。
この仕組みの実装では、ベースモデルを変更することなく、小規模な制御器で二つの依存性ダイアルを操作できます。制御器のみが訓練可能で、スコア関数推定器を用いた勾配計算では、フローズンネットワークは順伝播のみで済み、勾配計算を制御器に限定できるため、計算効率が向上します。初期的なパイロット実験により機構と訓練方法の妥当性が検証されていますが、タスクレベルでの詳細なファインチューニング効果の確立には至っていません。