arXiv (NLP)AI
自己改善型分類器SIFT:動的文書分類のための凍結ゲート訓練
A Classifier That Teaches Itself: Self-Improving, Frozen-gate Training (SIFT) for Dynamic Document Classification
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
文書分類は実験室では解決済みの問題だが、企業実運用では依然として多くの課題が残されている。その最大の障壁はモデルアーキテクチャではなく、モデル構築に先立つ大規模なラベリング作業と、一度デプロイされたモデルの自動再学習に対する組織的な懸念である。研究チームが提案するSIFT(Self-Improving, Frozen-gate Training)は、これら両方の課題に対処する動的分類サービスである。
SIFTの特徴は、意図的に安価なCPU型のパイプラインから分類を実行し、SPLADE疎符号化器とLightGBMヘッドで初期判定を行うという階層的な設計にある。信頼度が低いページのみが高精度なLLM判定へエスカレーションされる。重要なのは、このLLM判定結果が自動的にラベル付きコーパスに書き戻される点である。これにより高価な大規模モデルが安価なモデルを継続的に教育し、エスカレーション率は低下、コーパスは事前の手作業ラベリングではなく本番運用トラフィックから成長していく。精度は使用するにつれて複合的に向上する仕組みである。
新しい文書カテゴリの追加は、単なる宣言的なバンドル、ラベル空間、アンカーフレーズ、判定官用語辞書を指定するだけで済み、大規模なラベリングプロジェクトが不要になる。
最大の課題は安全性である。自律的に再学習する分類器は知らぬ間に性能が低下する可能性がある。SIFTはこれを「凍結ゲート」機構で解決する。重要ラベルのF1スコア回帰チェックと、モデルが学習しない凍結された金標準回帰セットの二部構成で、どちらかが条件を満たさなければプロモーションを拒否する。これにより「月次の人手なし再学習」が無責任な試みではなく通常の手順へと変わる。論文ではアーキテクチャ、自己給餌コーパスループ、凍結ゲートメカニズム、複数ドメインでの実装例を述べ、ラベリングの周辺コストがゼロに向かう分類器の経済効果を論じている。