arXiv (AI)AI
医療テキストにおけるLLM透かしの評価:誤った症状を標識する問題
Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)の臨床現場への導入が進む中、モデルが生成した出力の追跡可能性を確保するための透かし技術(ウォーターマーキング)の重要性が高まっている。しかし現在、ほとんどの透かしは汎用ベンチマークで評価されており、医療分野のような領域では十分に検討されていない。医療では、トークンレベルのわずかな摂動でも意味的に大きな変化をもたらす可能性があるため、この空白は深刻な問題となっている。
本研究は、LLMの透かしが医療パフォーマンスに与える影響を初めて本格的に調査したものである。研究チームは5種類の透かしスキームを11個のLLMと7個のビジョン言語モデル(VLM)上で、単一モダリティおよびマルチモダリティの臨床推論タスクを含む様々なタスクでベンチマーク化した。特に重要なのは、医療専門家の検証を受けた医療推論品質、用語的正確性、および幻覚現象を体系的に監査するパイプラインを新たに導入したことである。
その結果、透かしは語彙の破損、用語の幻覚、画像所見の誤属性または省略の増幅を含む複数の障害モードにわたって、実質的な性能低下を引き起こす可能性があることが明らかになった。特に注目すべき点は、ドメイン固有の分析がないこと、ならびに臨床テキストに内在する障害を見落とす集計メトリクスが、透かしによる実際の性能低下を組織的に隠蔽する可能性があることである。本研究の知見は、医療分野での透かし付きモデルの安全な導入のためには、ドメイン固有の評価が前提条件であることを確立している。現在のベンチマークは、臨床的に重要な障害を見過ごす可能性があるからである。