arXiv (AI)AI
TITLE_JA: ベンチマーク推論の合成可能性の問題:AI評価における射影可能性
When benchmark inferences do not compose: Projectibility in AI evaluation
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
AI システムの性能評価において、ベンチマークの結果から実際の有用性や能力に関する結論を導き出すプロセスは、想像以上に複雑であることが研究によって指摘されている。単一のベンチマーク結果は、それだけでは決定的な主張にはならない。評価者たちはこの結果をさらに広い範囲の事例に一般化し、AIの能力の証拠として解釈し、新しいタスクに外挿し、別のシステムや環境に転用し、人間による審査や実際の運用上の結果についての仮定と組み合わせていく。妥当性中心のアプローチでは、こうした各ステップの主張に対する証拠が必要とされる。
本研究が特に指摘する重要な認識論的問題が「合成可能性の欠如」である。個々のリンクが正当化されていても、それらが自動的に正当な連鎖を形成するわけではないということだ。ある研究の対象が次の研究の出発点にはならないかもしれず、システム、対象集団、結果測定、あるいは条件が段階ごとに変わる可能性がある。さらに、データやモデルの系統を共有していると、外見上は独立した支証でも実は依存関係にあることがある。
射影可能性とは、観測された事例から未観測の事例への限定的な拡張が正当化されるかどうかの問題である。この研究では、隣接する複数の射影をそれぞれ支持する証拠があっても、それらを合成して結論づけるには、エンドポイントと仮定が一致し、依存関係と不確実性が全体を通して保持されている必要があることが示されている。法律研究のケーススタディを通じて、ベンチマーク証拠と実装研究がそれぞれ独立して妥当でありながらも、並列的に存在するにとどまる状況が示される。さらに再分析とシミュレーション結果は、なぜ集計の安定性が、後続の射影で必要とされる区別を消去してしまうのかを明らかにしている。