arXiv (NLP)AI
大規模言語モデルの虚偽叙述の抑制を評価する新しいプロトコル「LENS」の提案
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)が虚偽やプロパガンダと一致した叙述フレームを説得力のある説明として再現できることは、既存の機械学習アルゴリズムがこうした振る舞いを抑制できるかどうかという重要な問題を提起しています。新しい研究は、この課題に対処するためにLevel-based Evaluation of Narrative Suppression(LENS)と呼ばれる評価プロトコルを導入しました。このプロトコルは、直接的、帰属的、対比的、抽象的という4つの抵抗レベルにおいて、特定の叙述の再現を測定できるように設計されています。
研究では、NATO拡大によってロシアのウクライナ侵攻が強制されたと主張する叙述、およびアメリカが台湾を搾取または見捨てていると主張する叙述という2つの実世界に基づいた物語を対象としました。評価対象となったモデルはLapa LLM、Gemma-12B、Qwen-14B、TAIDE-Gemmaの4つの約12Bパラメータの多言語指示調整モデルです。
研究チームはSuppression-Collapse Efficiency(SCE)スコアという新しい指標を提案し、これはターゲット叙述の抑制を報酬として与える一方で、モデルの性能低下にペナルティを課します。実験結果から、選別されたチェックポイントにより叙述の再現を削減でき、抑制効果が直接的な忘却プロンプトを超えて転移する可能性があることが示されました。さらに、興味深い副作用として、抽象的なA/B/Cプロンプトは、学習アンラーニング後にモデルが対象フレームに関連付けられた現実世界のアクターを復元する可能性があることが報告されています。これらの知見は、LENSが叙述のアンラーニングのより深い構造に関する研究を報告し、指導するための効果的な診断プロトコルであることを実証しています。