arXiv (NLP)AI
TITLE_JA: LLMの推論プロセスから文学的品質に関する暗黙の理論を抽出・検証する
What is Good? Extracting and Testing Implicit Theories of Literary Quality from LLM Reasoning Traces
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
文学作品の「良さ」とは何か――この問いは文学研究と計算言語学の分野で常に議論されてきた。本研究では、推論機能を備えたLLMがどのようにして文学的品質を評価するのかを、2つの研究を通じて調査している。
第1の研究では、カノン文学から匿名掲示板への投稿まで、6つの品質レベルにわたる30の実際のテキストからなるベンチマークを構築し、LLMの推論トレース(推論過程の記録)からモデルが保持する暗黙の品質理論を抽出した。DeepSeekの5つの複製実験により、モデルは平均79.3%の段階分類精度を達成している。推論トレースから明らかになったのは、一貫した理論:モデルは正確さよりも意図性を重視し、工芸性、深さ、独特の声(ボイス)を優先しているということだ。スタイルマッチングされた認識不可能な一節を用いた実験により、出典認識がスコアを水増しする可能性が示唆されたが、この結果は正規の作品と研究者が作成したパスティーシュ(模倣作)との本質的な品質差によって複雑化している。
第2の研究では、この理論を5つのカノン散文に対する段階的な劣化操作を通じて精査した。語彙の簡潔化、リズムの平坦化、意象の除去、ボイスの一般化、構造の簡潔化、および複合的劣化の6つの操作を適用し、各バージョンを再評価した。語彙簡潔化による品質低下は最小限(0.41±0.46ポイント)で、構造(2.78)やボイス(2.34)の低下をはるかに下回っている。複合劣化は破壊的(-5.64)だが、相加を下回る効果を示す。別モデルのQwen QwQとの比較でも、同様の広範な定性的パターンが見られた。
これらの研究は、LLMによる文学的品質の判断は総体的で著者固有のものであり、語彙的特徴よりも構造的特徴に対してより敏感であることを示唆している。この知見は自動執筆フィードバックと計算美学に重要な含意を持つ。