arXiv (NLP)AI
不均衡データのクラスタリング:GMMとLLMを用いた標的型データ拡張
Imbalanced Data Clustering via Targeted Data Augmentation Using GMM and LLM
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
自然言語処理(NLP)の分野では、少数派トピックの扱いが大きな課題となっています。特に教師なし学習のクラスタリングタスクでは、データに含まれる少数派トピックが十分に捉えられず、分析の精度が低下する傾向があります。こうした問題に対応するため、ガウス混合モデル(GMM)と大規模言語モデル(LLM)を組み合わせた新しい教師なしデータ拡張手法が提案されました。
このアプローチの特徴は、二つのモデルの強みを活かした組み合わせにあります。GMMは柔軟性と堅牢性に優れており、データ内の少数派エリアに対応するクラスタを効果的に検出することができます。一方、LLMはこれらの検出されたクラスタに対して合成ドキュメントを生成し、少数派トピックの表現を豊かにすることで、データセット全体のバランスを改善します。
様々な不均衡テキストデータセットを用いた実験結果によると、この手法は全ての場合においてクラスタリング性能を維持し、多くの場合ではクラスタの解釈可能性を向上させることが確認されました。結果として、教師なしNLPタスクにおけるデータ表現の改善に対して、堅牢でスケーラブルなソリューションを提供する方法論として機能することが実証されています。