arXiv (AI)AI
TITLE_JA: 数学問題解法におけるRL微調整とSFT微調整モデルの推論性能差の起源:表現品質の分析
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデルの推論能力向上に向けた研究が進む中、強化学習(RL)によって訓練されたモデルが教師あり微調整(SFT)されたモデルよりも数学推論タスクで優れた性能を発揮することが明らかになっています。しかし、このような性能差がどのような機構的メカニズムによって生じているのかは、これまで十分に解明されていませんでした。今回の研究は、RLモデルとSFTモデルの内部的な表現構造の違いに焦点を当て、この優位性の根拠を探っています。
研究チームは二つの収束する証拠を提示しています。第一に、各層の隠れ状態に対して訓練された線形プローブを使用した分析により、RLモデルはSFTモデルと比較して答えの正否予測において高い精度を達成することが判明しました。これは、RLモデルがより線形に分離可能で構造化された表現を発達させていることを示唆しています。第二に、平均アブレーション研究から、RLモデルはより深い層ほど重要性が増す階層的アーキテクチャを構築する傾向がある一方、SFTモデルは全層にわたって重要性を均等に分散させていることが明らかになりました。
さらに研究では、繰り返しサンプリング時のトークン数の可変性を分析し、計算資源の適応的配分能力を検討しました。RLチューニングされたモデルの一部でSFTモデルよりも高い可変性が観察される一方で、他のモデルでは強い一貫性が見られ、トークン配分がRL対SFTの別よりも全体的な訓練パイプラインに依存する可能性を示唆しています。これらの知見は、RLトレーニングが推論問題の表現と処理方法を根本的に再構成し、安定した政策を示すモデルと不完全に特定された解挙動を持つモデルの違いを明らかにしています。