arXiv (NLP)AI
TITLE_JA: MoEルーティングはハフマン符号か?思考の連鎖における周波数・多様性則の発見
Is MoE Routing a Huffman Code? Discovering the Frequency-Diversity Law in Chain-of-Thought
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
Mixture-of-Experts(MoE)アーキテクチャは大規模言語モデルのスケーリングに革命をもたらしましたが、そのルーティング機構の根本的な原理は長らく不明確でした。arXivに投稿されたこの論文は、MoEのルーティングが単なる専門家選択ではなく、情報理論におけるハフマン符号化の具体的な現れであることを実証しています。
研究チームは「周波数・多様性則」という基本原理を発見しました。Phi-3.5-MoEやGemma-4-27B-A4Bといった最先端モデルは、意図せずして情報理論的エンジンとして機能しており、出現頻度の高いトークンには少数の専門家を割り当てる一方で、思考の連鎖タスク内の稀で複雑な問題に対しては多様性に富んだ専門家委員会を起動していることが判明しました。
しかし同時に、Qwen3.5-35B-A3Bモデルには「冗長性の罠」が存在することも明らかになりました。有効スパース性(k/E_eff)が十分に低い場合、ロードバランシング制約が機能的冗長性を生み出し、潜在的なハフマン効率シグナルを隠蔽してしまうのです。これに対処するため、研究者らは機能的重複を排除する「部分集合差分プルーニング」を提案しました。
この戦略により、モデルの推論性能を損なうことなく潜在的なハフマン効率を引き出し、ルーティング論理を効率的で高密度な経路に収束させることが可能になります。今後のMoEアーキテクチャは強制的なロードバランシングから脱却し、最小記述長(MDL)最適性を目指すべきだと論文は提唱しています。高頻度情報には短いルーティングコードを、低頻度情報には長く多様なコードを割り当てることで、ルーティングをヒューリスティックから原理的な圧縮エンジンへと転換させるという展開が期待されています。