arXiv (NLP)AI
LLMベースの自動査読におけるレビューアーガイドライン設計の影響評価
Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
科学研究における査読プロセスは品質保証の重要な要素ですが、急増する論文投稿に対応するため、その自動化が急務となっています。本研究は、異なるタイプのレビューアーガイドラインがLLM(大規模言語モデル)ベースの自動査読システムにどのような影響を及ぼすかを分析しています。具体的には、学会の公式ガイドラインと、高品質な人間による査読からLLMを用いて生成された「査読者模倣型」ガイドラインの2つを比較しています。
実験結果は興味深い知見をもたらしています。学会の公式ガイドラインを使用した場合、自動生成された査読結果が人間の判断と最も一致することが明らかになりました。これは、学会の実践を通じて洗練された評価基準が、自動査読システムのための効果的なガイダンスとして機能することを示唆しています。一方、査読者模倣型ガイドラインは全般的に公式ガイドラインよりも性能が低く、単に人間の査読パターンを模倣するだけでは十分でないことが判明しました。
さらに注目すべき発見として、厳密なルーブリック形式のスコアリングを強制すると、一貫して性能が低下することが示されました。このことは、自動査読システムに対しても、定型的な採点方式よりも主観的で全体的な評価を許可することの重要性を浮き彫りにしています。研究成果は、AI時代の査読プロセス自動化における最適なガイドライン設計に関する実践的な示唆を提供するものです。