arXiv (NLP)AI
TITLE_JA: 評価設計がMeSHの専門家自動割り当て比較に与える影響:Cohen ベンチマークでの bag-of-words と BiomedBERT の対照研究
Evaluation design conditions the expert-vs-auto MeSH gap: a controlled comparison of bag-of-words and BiomedBERT on the Cohen benchmark
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
医学文献のスクリーニングにおいて、分類器の性能は入力特徴の選択に大きく左右される。本研究は、Medical Subject Headings(MeSH)という医学用語の割り当て方法の違いが、文献分類性能にどの程度影響するかを系統的に検証した。MeSHは専門の索引作成者によって手動で割り当てられるか、自動ツールで即座に割り当てられるが、これまでこの二つの方法を分類器の特徴として直接比較した研究は存在しなかった。
研究チームはCohen らによる 2006 年のベンチマーク(スタチン、オピオイド、ADHD の 3 つのトピック)を使用して、bag-of-words ロジスティック回帰分類器と BiomedBERT トランスフォーマーモデルの性能を評価した。評価設計が結果に与える影響を明らかにするため、複数の条件下での比較を実施している。標準的な 5 分割交差検証での結果では、スタチンに関して専門家割り当て MeSH と自動割り当て MeSH のパフォーマンス差は WSS@95% で +0.096 に達した。
しかし評価設計を変更すると、この差は著しく縮小した。より小さいデータセット(n = 803)を使用した場合は +0.033、10 分割交差検証では +0.021 となり、後者ではブートストラップ信頼区間がゼロを跨いだ。BiomedBERT では標準評価下で +0.020 であり、10 分割 bag-of-words の結果とほぼ同等だった。さらに重要な発見として、専門家割り当て MeSH を追加すると、スタチンデータセットの 15.1% が BiomedBERT の 512 トークン制限を超過することが判明した。この表現の非対称性がトランスフォーマーの小さなギャップに寄与している可能性があるが、訓練量の影響と完全には分離できないとしている。研究結果は、ベンチマーク評価における結論が評価設計の変更によって大きく変わる可能性があることを示唆している。