arXiv (AI)AI
RLHF学習データにおける評価者の状態バイアス:監査フレームワークの提案
Rater State Bias in RLHF Preference Data: An Audit Framework
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
強化学習と人間フィードバック(RLHF)を用いたAIモデルの学習プロセスに、新たな構造的バイアスが存在する可能性を指摘する研究が発表されました。RLHFでは、人間の評価者がAIの出力ペアを比較して「どちらが良いか」という選好ラベルを付与しますが、この過程で評価者自身の精神状態が判断に影響を与える可能性があるというのが今回の研究の主張です。
研究チームは、長時間のストレスや心理的負荷がかかった状態で作業する評価者の選好が時間とともに変化することを指摘しています。このようなシフトは単なる評価者間の意見相違や無作為なラベルノイズではなく、特定の条件下で複数の評価者に共通して現れ、その後の報酬モデルと政策最適化プロセスに伝播する可能性があります。言い換えれば、評価者の心理状態に基づく「相関したバイアス」がRLHFデータに組み込まれ、学習されたAIモデルに組み込まれるリスクがあるということです。
本研究は、このバイアスの存在を特定・検証するための監査フレームワークを提案しています。評価者の状態シフト、状態の交絡、および相関した評価者状態バイアスを定義し、語彙的・語用論的・談話的特徴を用いた測定可能な反応パターンを導入しています。また、5つの反証可能な予測と効果量の閾値を設定し、公開されている命令チューニングモデルに適用可能な監査プロトコルと予備研究計画を提示しています。このフレームワークは、RLHFプロセスにおける構造的バイアスの起源を特定する上で重要な一歩となるでしょう。