arXiv (ML)AI
DataPrep-Bench:LLMの訓練データ準備能力を測定する統合ベンチマーク
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の性能は訓練データの品質によって大きく左右されます。しかし現在まで、LLMやエージェント、データ中心のワークフローが訓練データの準備をどの程度効果的に実行できるかを測定する統一的なベンチマークが存在していません。このギャップを埋めるため、研究チームは「DataPrep-Bench」と呼ぶ初の統合ベンチマークを開発しました。このベンチマークは、LLMによるデータ準備を2つの相互補完的な能力から評価します。第一は「データ構築」で、生のデータ源を教師あり学習用の訓練データに変換する能力を指します。第二は「データ品質評価」で、下流の訓練が実行される前に、候補データセットの訓練価値を予測する能力です。ここで「品質」とは、テキストの表面的性質ではなく、実際の下流訓練の有用性を意味します。
DataPrep-Benchは6つのドメインと複数のベースモデルにおいて、両能力を共通の下流指向プロトコルの下で同時に評価する統合プラットフォームです。データ構築部門では、複数の手法が同一の生データ源を消費し、その出力に対してDolly-15kと共同でベースモデルをファインチューニングすることでスコアが付与されます。この領域で研究チームは「Data-Construction-Skill」という技能指導エージェントをリリースしました。このエージェントはLlama-3.1-8Bの金融タスクにおいて、従来のDolly単体ベースラインから約20ポイントの絶対的な改善を達成し、知識抽出が密集したドメインではエージェントベース及びDataFlowベースの手法と同等の性能を発揮します。
データ品質評価部門では、スコアリング関数は共通の候補プール上で下流性能とのピアソン相関によって評価されます。研究チームは「分布的整列スコア(DAS)」という新しい分布ベースの評価器をリリースしました。DASは候補データセットとドメインプロキシ間の最大平均乖離度(MMD)を用いており、6ドメイン中4ドメインで最強のクロスモデル相関を達成し、数学・科学・医学分野で同時にr > 0.70を超える唯一のメトリクスとなっています。既存の品質・多様性・ヒューリスティックベース評価器を上回る性能を示しています。DataPrep-Benchは、LMM駆動型データ準備における両能力の進歩を、同等の重要性を持つターゲットとして測定するための統一的で下流指向型の枠組みを提供します。