arXiv (ML)AI
サイバー防御のためのLLM忘却:方法、課題、および新興脅威に関する調査
LLM Unlearning for Cyber Defense: A Survey on Methods, Challenges, and Emerging Threats
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)がヘルスケア、金融、教育、意思決定支援といったセキュリティが重要なシステムに急速に導入される一方で、これらモデルが情報を「忘却」できないことが深刻なサイバーセキュリティ、プライバシー、安全上のリスクを生み出しています。デプロイ後も、個人情報や著作権保護された資料、危険な領域知識、訓練データから学習した情報が数十億のパラメータに暗号化されたままの状態で保持され、抽出攻撃やジェイルブレイク攻撃、メンバーシップ推論攻撃、規制要件への非準拠といった脅威にさらされています。チャットボットが個人情報を再生成する事例から、架空の法律引用が法的および金銭的損害をもたらす実例まで、これは単なる理論的な問題ではなく、新興脅威の中心に位置する現実的な課題となっています。
数十億のパラメータを持つモデルの完全な再訓練は計算上実現不可能であり、LLM内の知識がパラメータ全体に分散・絡み合っているため特定の単位に局在していないことから、LLM忘却がサイバー防御の主要な対策として浮上しています。この手法は再訓練なしに、またモデルが保持すべき知識を損なわずに、特定の知識を訓練済みモデルから削除または抑制することを目指しています。
しかし重要な問題が未解決のままです。現在の方法は本当に知識を削除しているのか、それとも単に通常のプロンプト条件下での表現を防いでいるだけなのか、という点です。本調査は、セキュリティ、堅牢性、検証可能な忘却の観点からLLM忘却を検証しており、勾配ベースの手法が既存の訓練パイプラインとの互換性と数十億パラメータモデルへのスケーラビリティにより分野を支配していることから、これらの手法を重点的に取り上げています。