arXiv (NLP)AI
自然言語オートエンコーダを用いたQwen2.5-7Bにおけるコロンビア人アイデンティティの潜在的推論の調査
Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)は、明示的に述べられていない場合であっても、微妙な言語的手がかりから人口統計的属性を推論する可能性があります。本パイロット研究では、Qwen2.5-7B-Instructがコロンビア・スペイン語と英語のプロンプトを処理する際に、コロンビア人としてのアイデンティティ、社会経済的地位、またはステレオタイプ関連の情報を内部的に表現しているかどうかを調べています。
研究チームは自然言語オートエンコーダ(NLA)を活用して、プロンプトごとに20層から4つの位置四分位にかけての残差ストリーム活性化を言語化しました。データセットは、明示的なコロンビアの手がかり、暗黙的なコロンビアの手がかり、および中立的なコントロール条件を含む15組のマッチされたスペイン語英語ペアからなる30個のプロンプトで構成されています。
本研究では統計的に検証された効果よりも記述的レートと定性的証拠に焦点を当て、潜在的な国籍またはステレオタイプの表現がモデル出力で言語化される前に現れるかどうかを調査しています。このアプローチは活性化レベルの解釈可能性とバイアス評価を、過小評価されているスペイン語方言に関連付けることで、LLMの公平性と透明性に対する理解を深める貴重な貢献となります。