arXiv (NLP)AI
出力トークン予算制限が多言語推論格差の測定に与える隠れた影響
Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
多言語モデル評価における重大な問題が指摘されました。従来、多言語評価では単一の出力トークン上限で精度を測定していますが、異なる言語は同じ内容を表現するのに必要なトークン数が異なるため、この上限は隠れた実験変数として機能しているというのです。
研究者らはQwen3-8BとLlama-3.1-8B-Instructを用いて、MGSM(ドイツ語、タイ語、スワヒリ語)ベンチマークにおけるネイティブ言語と翻訳言語のパフォーマンス格差が、トークン予算の制約による人工産物なのかを検証しました。四つのプロンプト戦略下で測定した結果、予算によって格差が最大57ポイント変動することが判明しました。さらに長さ正規化を適用すると、予算制限が機能する領域では最大38.9ポイント移動し、厳しい上限では正規化によって最適戦略の順位が逆転することもありました。
研究チームは三つの独立した検証方法を採用しました。まずQwenの三つのピーク値を1024トークンで凍結し、54万回の独立した厳密にキャップされたデコード上で評価したところ、ホルム補正テストはすべてのヌル仮説を棄却しました。また、タイ語の語彙拡張により、凍結予算での格差は0.0ポイントでしたが、19%のトレースがまだ切り詰められている領域では4.9ポイント閉じられました。発表された予算を128トークンから2048トークンに変更するだけで、タイ語ネイティブ精度は5.1ポイント変動することも確認されました。
これらの知見から、研究者らは出力トークン上限を独立変数として扱い、単一予算ではなく予算体制全体にわたって精度を報告すべきだと提言しています。この修正により、言語間の真の推論能力差と、測定方法による人工産物を区別できるようになるでしょう。