arXiv (NLP)AI
神経形態型拡散言語モデル:スパース性とブロック除去ノイズによる計算・メモリボトルネック解決
Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の推論効率向上を目指す新しい研究が発表されました。従来の自己回帰型LLMは、生成する各トークンに対して全パラメータにアクセスする必要があるため、計算効率が低く、エネルギー消費が多いという課題を抱えていました。この問題に対して、マスク付き拡散言語モデル(MDLM)は単一のパラメータアクセスで複数トークンを生成することで、メモリ制約環境での効率性を向上させてきました。
本研究では、神経形態型拡散言語モデル(N-MDLM)を提案しており、ブロック拡散とスパイク型神経形態計算を統合することで、スループットとエネルギー効率をさらに改善する方法を示しています。ブロック拡散によって複数トークンを同時生成するメリットに加え、スパイク誘導スパース性により非活性チャネルの処理をスキップすることで、有効なパラメータトラフィックと計算量を削減できます。
研究チームはトークンレベルの分析モデルを開発し、ブロック並列生成とスパース性が復号化効率に与える相乗効果を定量化しました。翻訳タスクでの実験結果によると、スパース性の効果により、計算制約が厳しいプラットフォームでもN-MDLMは従来のAR-LLMを上回るエネルギー効率とスループット改善を実現できることが実証されました。この成果は、エッジデバイスやリソース制約のある環境でのLLM推論の実用化に向けた重要なステップとなるものです。