arXiv (ML)AI
LLMトークン生成における動的システム識別可能性の理論的保証
Guarantees on Dynamical System Distinguishability for LLM Token Generation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の応答を分類する新しいアプローチとして、トークン埋め込みをブラックボックス動的システム(DS)の軌跡としてモデル化し、2つのDS間の予測残差を比較する手法が注目されています。この動的システムベースのアプローチは経験的な成功を収めていますが、その理論的基礎や性能スケーリング、異なる埋め込みモデル間での転移可能性についての理論的理解は依然として不足していました。
本研究は、これらの疑問に答えるべく、分類タスクを2つの確率的線形DSの間の二値仮説検定として形式化しました。研究チームは、2つのDSのダイナミクスが大きく異なる場合であっても、その定常辺周分布間の全変動距離は任意に小さくなりうることを示しました。この発見は、トークンの動的特性を無視する分類器に対する基本的な精度の下限を提供します。さらに、DS ベースの分類における誤分類確率がシーケンス長 $L$ に対して指数関数的に減少することを証明し、その減衰は2つのDS間のスペクトル距離を捉える動的識別可能性量 $\delta^2$ によって支配されることを示しました。
クロス埋め込みの汎化可能性については、埋め込みモデル間の近似相互絡み条件を導入し、相互絡みマップの最小特異値に関して転移可能な識別可能性の下限を確立しました。これらの結果は、DS ベース分類の経験的な性能を説明し、AIが動的システムをモデル化するという従来のアプローチとは対照的に、動的システム理論を用いてAIシステムを分析することの重要性を示唆しています。