arXiv (NLP)AI
TITLE_JA: 複数エージェント視点主義的嗜好最適化を用いたセクシズム検出の学習
Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
テキストのセクシズム検出において、アノテーター間の意見の相違は単なる間違いではなく、セクシズムに対する認識そのものが本質的に異なることに起因します。従来のNLP システムはこうした多様な視点を多数決で統合して捨ててしまいますが、新しい研究はこの貴重な相違を保持することの重要性を示しています。
提案されたMulti-Agent Perspectivist Preference Optimization(MAP-PO)フレームワークは、このアプローチを実現するものです。EXIST 2024データセットの英語とスペイン語ツイートを対象に、研究者たちはまずアノテーターを人口統計学的属性ではなく、ラベリング行動に基づいてクラスタリングしました。その後、各クラスタごとに1つの大規模言語モデル(LLM)エージェントをファインチューニングし、そのクラスタの注釈行動を再現させます。嗜好最適化により個別レベルとチームレベルの報酬を組み合わせることで、複数のエージェントを協調させます。
評価は2つの言語と2つのバックボーン言語モデルで定義された4つの設定で行われ、各エージェントが自身のクラスタの注釈を再現するか、またエージェント全体で多数決ラベルを再現するかが検証されました。すべての設定で一貫した2つの重要な発見が得られています。第一に、ファインチューニングなしではエージェントはほぼ同一の振る舞いをするため、クラスタ固有の訓練が必須であること。第二に、各エージェントを自身のクラスタのラベルのみで訓練すると、表現すべきクラスタから大きく乖離してしまう一方で、共有されたチームレベルの訓練信号を追加することで、各エージェントが常に自身のクラスタに校正されることが示されました。