arXiv (ML)AI
TITLE_JA: LARA:残差ストリームの軽量アダプターによる組み合わせ可能な適応とアライメント
LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデルの効率的な適応手法として、新たなアプローチが提案されました。LARA(Lightweight Additive Residual Adaptation)と呼ばれるこの手法は、モデルの重みを変更する従来の方法とは異なり、モデルの残差ストリーム内で動作します。既存の主流手法であるLoRAが重み行列に低ランク更新を加えるのに対して、LARAは限定されたレイヤーの隠れ状態を読み取り、低ランク補正を残差ストリームに追加することで、ベースモデルの重みは完全に保持したままにします。
コードのファインチューニングタスクと選好最適化(DPO)の実験では、LARAはパラメータ数が同等な場合にLoRAと同等の性能を達成しています。さらに重要な点として、LARAは推論時に適用されるスケールパラメータγを公開することで、ベースモデルと適応済みモデルの動作を滑らかに補間できます。これは重み空間での適応では提供できない段階的な制御形態であり、実装の柔軟性を大幅に高めます。
LARAの最大の利点は、複数の動作を単一の凍結ベースモデル上で同時に保有できることです。研究では、1.5BパラメータのモデルにファインチューニングされたBehavior 6つと選好最適化されたBehavior 1つの合計7つを搭載し、わずか約33MBのオーバーヘッドで運用することに成功しました。これは従来の方法で各動作ごとに独立したモデルを保持する場合と比べて、極めて効率的です。ベースモデルが変更されないため、各動作は個別に訓練され、トークンごとに自動的にルーティングされます。この特性は、単一デバイス上で多数の動作を運用し、新しい動作を追加する際に特に適しており、エッジデバイスでの大規模モデル運用の実現性を高めるものとなっています。