arXiv (Neural Computing)AI
TITLE_JA: SMM Transformer:スパイキングニューラルネットワークを活用したマルチモーダルタスク処理
SMM Transformer: Leveraging Spiking Neural Networks for Multimodal Tasks
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
スパイキングニューラルネットワーク(SNN)は、イベント駆動型の計算と疎な活性化により、従来のニューラルネットワークと比べてエネルギー効率に優れていますが、複数の入力形式に対応するマルチモーダルTransformerの構築は困難でした。特に、深いスパイキング層でのトレーニング不安定性と、密集したsoftmax attention機構とスパイク基盤通信の不適合が、実装の大きな障壁となっていました。
このような課題に対して、研究チームはSMM Transformerという新しいフレームワークを提案しました。このフレームワークは3つの主要な技術革新で構成されています。まず、PLMP(Parallel LIF with Multistage Learnable Parameters)と呼ばれるニューロンモデルと、それに対応する改良型P-STBPアルゴリズムにより、深いSNNのトレーニング安定性を実現しています。次に、SMSA(Spike-driven token-mixing attention)は、従来の密集したペアワイズのsoftmax attentionをチャネル単位のスパイク共活性化と自己補償メカニズムで置き換える、スパイク駆動型のトークン混合モジュールです。最後に、SMoE(spiking mixture-of-experts)が、異なるモダリティ間の融合を効率的に実現します。
視覚およびマルチモーダルベンチマークでの評価では、SMM Transformerは従来の人工ニューラルネットワーク(ANN)ベースラインと比較して競争力のある精度を実現しています。注目すべきは、標準的なMAC/AC演算モデルの下で、SMSA機構は注意モジュールの推定演算エネルギーを最大97%削減し、全モデルプロファイリングでも一貫した効率向上を実現している点です。本研究は、エネルギー効率とマルチモーダル処理能力の両立という課題に新しい解決策をもたらすものとなっています。