arXiv (ML)AI
Progressive²:大幅なモデル圧縮のための教師-生徒漸進的共進化知識蒸留法
Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
知識蒸留(KD)は、大規模なモデルから小規模なモデルへ知識を移転させる広く利用されている技術です。サーバー側の大規模モデルをクライアント側の要件に合わせて圧縮し、サービス品質(QoS)を満たすために幅広く応用されています。しかし、サーバーの処理能力とクライアントの要件の間に大きな差がある場合、蒸留の性能が大幅に低下するという課題がありました。
この問題に対処するため、研究者らは「Progressive²」という新しい蒸留アプローチを提案しました。このアプローチは、段階的に強化される教師モデルと段階的に小型化される生徒モデルの組み合わせによって機能します。教師側では、すべてのレイヤーを同時に関与させるのではなく、意味的情報が単純から複雑へと進むカリキュラムに従って、追加のレイヤーを段階的に選択します。また、教師側マルチ機能融合アダプタを設計し、Lipschitz連続性の理論的枠組みにより訓練の安定性を向上させています。
生徒側では、小さなモデルを直接訓練するのではなく、ネットワークのサイズを段階的に削減することで、教師との反復的な共進化を実現します。Progressive²は柔軟なフレームワークとして機能し、教師の漸進的戦略を独立して展開して精度と訓練効率のバランスを最適化することも、教師と生徒の統合的なアプローチにより全体的な性能をさらに向上させることも可能です。