arXiv (NLP)AI
TITLE_JA: 敵対的スタイル最適化:GRPO ベースのスタイル的トリガー最適化による VLM ジェイルブレイクの強化
Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
マルチモーダル大規模言語モデル(MLLM)は優れた性能を発揮していますが、その安全性アライメントは依然としてジェイルブレイク攻撃に対して脆弱です。従来のコンテンツベースのジェイルブレイク手法は一貫性に欠け、急速に進化する MLLMs に対して満足のいく性能を示せず、コンテンツ以外の脆弱性を活用できていません。本研究では、MLLM が「スタイル的不一貫性」を示すことを実証しました。つまり、MLLM は視覚的なスタイルに関わらずコンテンツを堅牢に理解できる一方で、その防御メカニズムは特定のスタイル的トリガーによって容易に回避されるというものです。
この知見に基づいて、研究チームは敵対的スタイル最適化(ASO)という、既存のビジュアルジェイルブレイクを増幅するためのプラグアンドプレイなエンハンスメントモジュールを提案しました。ASO は画像編集モデルをファインチューニングし、最適化されたスタイル的修正を敵対的画像に重ね合わせます。このプロセスは、構造的階層報酬関数によって導かれる Group Relative Policy Optimization(GRPO)エージェントを使用し、明示的な拒否を検出するロジットベースの信号と強力なジャッジモデルからの高忠実度セマンティック評価を組み合わせています。
広範な実験により、ASO は最先端の攻撃の攻撃成功率(ASR)を大幅に向上させることが実証されました。この結果は、スタイル的バイアスが MLLM のレッドティーミングに対する拡張可能な手段であることを示しています。研究チームはコードを GitHub で公開しており、今後の研究や安全性検証に活用できる状態となっています。