arXiv (NLP)AI
TITLE_JA: RIMS:小規模言語モデルの検索拡張生成において平滑化された複数ペア集約を用いた選好最適化
RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
小規模言語モデル(SLM)はリソース制約のある環境での検索拡張生成(RAG)において有用ですが、その容量の限界により、ノイズの多い或いは虚偽の取得証拠に対して高度に敏感です。既存の選好ベースの手法であるRoseRAGなどは、困難な単一の選好ペアのみをハード引数最小値/最大値を通じて選択し、残りの信号を破棄しています。一方、複数のペアを独立した二値比較として扱う手法は、データ利用率が低くなるという課題を抱えています。
本研究では、RIMS(平滑化された複数ペア集約を用いた選好最適化フレームワーク)を提案します。このフレームワークは三段階の構成からなります。第一段階は、対象となるSLM自体を用いた拒否サンプリングを通じた合成チェーン・オブ・ソート選好データの生成であり、proprietary モデルへの依存を排除しています。第二段階は、ハード選択をスムーズな演算子で置き換える微分可能なソフト集約メカニズムであり、すべての選好ペアから勾配信号を保存しながらマージン認識選択の識別構造を保持しています。第三段階は、平滑化された目的関数を複数のアライメントアルゴリズムに適用した選好最適化です。
理論的には、平滑化近似が制御可能な誤差境界を認め、ソフト集約がハード選択よりも確実に厳密な勾配アライメントをオラクル目的関数に対して生じることを示しています。四つの複数ホップ質問応答ベンチマークでの実験により、本手法が複数のSLMバックボーン全体で最先端のベースラインを上回り、ノイズの多い検索条件下において正確一致とF1スコアで一貫した改善を達成することが示されました。