arXiv (AI)AI
TITLE_JA: 正確性だけでは不十分:マルチエージェント数学推論における評論家の精度と批判の採用の乖離
Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
複数のエージェントが協力して数学問題を解く際、専門の査読役を配置する階層的システムが効果的だと広く仮定されてきました。しかし、新たな研究がこの前提に疑問を呈しています。4,181個のOmni-MATHプロブレムを使用した実験では、同じgpt-oss-120bモデルを複数のアーキテクチャで検証しました。その結果、最も簡単な問題ではエージェント間の協力による改善は限定的でしたが、難易度が上がるにつれて、ブロードキャスト形式のピア討論(複数エージェントが同時に意見を出し合う方式)が、従来の計画者・実行者・査読者パイプライン(PER)を上回る精度を達成することが判明しました。
この結果の原因を探った結果、驚くべき事実が明らかになりました。PERシステムの査読者は、ブロードキャスト方式の査読者よりも精度が高い(0.861対0.644)にもかかわらず、査読者が指摘した有用な批判は、その後の候補回答をほとんど変えず、修正率も低かったのです。つまり、査読者が誤りを検出する能力と、その批判が実際に活用されるかどうかは、完全に別の問題であることが示唆されました。
さらに詳細な実験では、査読者の批判を明示的に承認させると最終精度が低下し、一方で査読者の指導を問題解決者の思考プロセスに直接組み込むと、ある程度の改善が見られました。これらの結果は、査読中心の評価方法が системの質を過大評価する可能性があることを示しています。エージェントが問題を検出できても、その指摘に実際に対応しなければ、より多くの問題を解くことにはつながらないのです。