arXiv (CV)AI
TITLE_JA: 言語モデルが人間の脳の高次視覚知覚をモデル化する際の有効性を決定する要因
What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
画像の説明を言語モデルで表現することで、人間の脳が自然画像に対して示す高次視覚領域での反応を予測できることが知られています。しかし、このような予測可能性を実現する具体的な要因については、これまで明らかにされていませんでした。この研究は、画像がどのように説明されるか、またどの言語モデルがそれらの説明の埋め込みに使用されるかを体系的に調査しました。
研究チームは、同じ画像セットに対して6種類のキャプションを検討しました。これには人間が手で注釈を付けたキャプションと複数の機械生成キャプションが含まれており、様々な次元で異なっています。各キャプションは5つの言語モデルで表現されました。これらのモデルには、次の単語を予測するように訓練されたオートレグレッシブLM(自己回帰型言語モデル)と、テキト埋め込み器、つまり文書レベルの表現を必要とするセマンティックタスクでファインチューニングされた言語モデルが含まれています。
興味深いことに、機械生成されたキャプションは、先行研究で使用されていた人間注釈キャプションを上回る、有意な脳予測可能性と整合性をしばしば示しました。キャプションタイプ全体を通じて、テキト埋め込み器はオートレグレッシブLMよりも一貫して優れた性能を発揮し、画像類似性判断による行動整合性を測定する際にも同じパターンが再現されました。異なるモデル層からのキャプション表現の分析から、脳予測可能性と行動整合性の両方が中間的なネットワーク深度でピークに達すること、これは構文的および意味的構造の出現を示す地点の直後であることが明らかになりました。本研究の結果は、画像キャプションの内容と、それを表現するために使用される言語モデルの両方が脳および行動モデリングのパフォーマンスに影響を与えることを示しており、キャプション埋め込みを高次視覚知覚の研究に有用なツールとして確立しています。