arXiv (NLP)AI
TITLE_JA: Chain-of-Models:複数モデル間の監査による認知バイアスに強いLLM判定システム
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)が自動判定システムとして活用される場面が増えていますが、これらのモデルの判定は認知バイアスの影響を受けやすいという課題があります。従来の対策はプロンプトベースのデバイアシング手法やヒューマン評価に依存していましたが、前者は特定のバイアスに対してのみ効果的で汎用性に欠け、後者はスケーラビリティの問題を抱えていました。
本研究は「Chain-of-Models」(CoM)と呼ばれる自動監査パイプラインを提案しています。このシステムでは、最初のモデルが判定を下す前に、別のモデル(監査役)が第一モデルの推論過程を検査します。研究チームは6つのモデルファミリーから9つのモデルを選定し、4つの異なる認知バイアス(バンドワゴン効果、権威効果、気を散らす効果、およびお世辞効果)と4つのファクトデータセットを用いて実験を行いました。
興味深い発見として、監査役のモデル選択がバイアスの種類に応じて異なることが明らかになりました。Kimi-K2.5は単独でいくつかのバイアスに対して強い耐性を示しましたが、Qwen2.5-72Bの偏った推論を監査する際には効果的ではありませんでした。一方、GPT-4oはバンドワゴン効果、権威効果、気を散らす効果に対して最も強い監査能力を発揮し、GLM-5はお世辞効果に対して優れた性能を示しました。
研究チームは、バイアスの種類に応じて監査役を選択するルールを開発しました。このルールは機能的多様性、バイアス固有の単独耐性、および校正された監査効果に基づいて候補モデルをスコアリングします。校正データ/テストデータの分割評価では、このアプローチは4つのバイアススライスにおいて最高精度(0.884)を達成し、単一の固定監査役(0.824)および監査なしのベースライン(0.805)を大きく上回りました。