arXiv (AI)AI
ThinkReset:限定されたコンテキスト窓における長期推論のための学習可能な中間インターフェース構築
ThinkReset: Learnable Intermediate Interface Construction for Bounded-Context Long-Horizon Reasoning
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
長い思考の連鎖(chain-of-thought)推論は複雑な問題の性能を向上させますが、同時に冗長性の蓄積、コンテキストオーバーフロー、そしてエラーアンカリングという課題も引き起こします。限定されたコンテキスト窓下において、真の課題は軌跡圧縮やテスト時制御にあるのではなく、廃棄された履歴に代わり得る再利用可能な中間インターフェースの不在にあるという見方が提示されています。
特に、結果報酬駆動型の長鎖強化学習には重大な失敗モードが存在します。モデルがウィンドウほぼ枯渇時点でまだタスクを解決できていない場合、最終答報酬はさらなる慎重な推論ではなく、時期尚早な推測を促す傾向があるというものです。この問題に対する解決策として、研究者らはThinkResetを提案しました。
ThinkResetはテキスト空間における中間インターフェースの明示的な構築を実現するもので、インターフェース書き込みとリセットを通じて再利用可能なインターフェースを生成し、リセット後の継続的な推論成功を直接最適化します。複数の長期推論ベンチマークにおいて、この新たなアプローチは固定コンテキスト窓下での成功率を一貫して向上させることが実証されています。このアプローチにより、限定されたリソース下でもより効果的な長期推論が可能になる道が切り開かれました。