arXiv (ML)AI
PhantomFill:フォーム形式が言語モデルに幻覚を引き起こす仕組み
PhantomFill: When the Form Demands an Answer, Language Models Invent One
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
言語モデルの実運用における問題が新たに明らかになった。テキスト生成ではなく、JSONフィールドや関数の引数、抽出テンプレートといったフォーム形式での回答が求められる場面で、モデルが虚偽の情報を生成する「幻覚」現象が頻発するというのだ。
研究チームは13のモデルに対して同じ質問を投げかけ、回答形式だけを変更する実験を行った。用意した入力は、回答が不可能な内容である。例えば、12,400のいいねを集めているが目に見える返信がない投稿や、通話が記録されていないサポートチケットといったケースだ。GPT-5.5がテキスト形式で答えると、98%の確率で正直に「返信データがない」と回答する。ところが、JSON形式で必須フィールドとして感情分析を要求すると、同じモデルは40回中40回、答えを捏造してしまう。見たことのない群衆の気分を作り上げ、聞いたことのない顧客の引用を生み出すのだ。
この傾向は極めて強力で、必須フィールドの存在により、13モデル中10のモデルで捏造率が100%に達する。「証拠不足」という選択肢を明示的に与えても、オープンウェイトモデル9個すべてがそれを無視する。「感情を推測するな」という直接的な指示も、スキーマが6モデル中4つでそれを上書きしてしまう。興味深いことに、この傾向はモデルの規模に比例していない。単一のモデルファミリー内でも、最小サイズは拒否し、中程度のサイズは捏造し、最大サイズは再び拒否するという矛盾した動作を示す。
研究チームはこの問題を測定するベンチマーク「PhantomFill」を公開した。決定的なスコアリング方式を備え、強制捏造率と回避利用率という2つの報告可能な数値を提供する。テストされた修正方法はスキーマの1行の変更に過ぎず、この問題はシステム全体に蔓延していることが明らかになった。