arXiv (NLP)AI
TITLE_JA: 性別曖昧な自然言語データを用いた機械翻訳のジェンダーバイアス分析リソース「GAND」の提案
Explaining GAND: A Resource on Gender-Ambiguous Natural Data & Contrastive Attribution
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
機械翻訳(MT)システムにおけるジェンダーバイアスは依然として重大な課題です。特に性的少数者や性別を限定したくないユーザーにとって、ステレオタイプに基づいた翻訳は有害な結果をもたらす可能性があります。本研究は、このような問題に対処するため、性別曖昧な自然言語データを使用したベンチマークリソース「GAND」を提案しています。
GANDは、英語の原文文を中心に構成されており、翻訳時に性別の手がかりが不明確な場面における翻訳システムの挙動を分析するために特別に設計されています。このリソースを通じて、文脈的な手がかりが翻訳における性別表現にどの程度影響を与えるかを調査することができます。
研究チームはGANDの一部をスペイン語やフランス語などの文法的性別を持つ言語に翻訳し、さらに意図的に作成した対比的な翻訳を加えました。その後、特徴帰属分析(feature attribution analysis)を実施することで、どの原文単語が文脈において曖昧な指示対象の性別翻訳に最も影響を与えているかを特定することに成功しています。このアプローチにより、翻訳システムの性別決定メカニズムがより透明になり、バイアスの根源をより深く理解することができるようになります。