arXiv (CV)AI
TITLE_JA: スタイルが優先される:感情説明の選好評価ベンチマークにおけるショートカット監査
Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
マルチモーダル感情理解の評価指標として、モデルが生成した感情説明に対する選好が標準的になりつつあります。MER2026のEmoPreferトラックなどのベンチマークでは、好まれた説明を予測するには、ビデオ、テキスト、音声にわたる接地的な相互理解が必要であると想定されています。しかし、この研究は内容を考慮しないプローブを用いてEmoPreferの体系的な監査を実施し、重大な問題を指摘しています。
単純ロジスティック回帰を説明文の長さとジェネレータのIDのみを用いて実行したところ、テキストやビデオ、音声を処理することなく、LoRAファインチューニングされた7Bのテキストおよび視聴覚判定モデルと同等の性能(EmoPrefer-V2で65.8対66.8 WAF)を達成しました。これは、現在のベンチマークが実質的な感情理解ではなく、表面的なスタイル情報に依存していることを強く示唆しています。さらに詳しく調べると、ジェネレータのIDは説明文から99.5パーセントの精度で復元可能であり、すべての候補ペアは異なるジェネレータを対比させ、人間の選好ラベルがジェネレータ固有の勝率事前分布と一致していることが判明しました。
長さを統制したサブセットでは統計的に有意な改善が見られず、スタイルショートカットを分離する診断手法では内容の判定がほぼ偶然レベルに留まります。これらの結果から、現在のスコアはビデオに対する説明の検証なしに達成可能であることが明らかになりました。研究チームは今後のクロスジェネレータ評価に向けて、ソースバランスの取れたペアリング、厳密な長さ制御、多注釈者の合意などを推奨しています。