arXiv (AI)AI
GuideSkill:臨床診療ガイドラインに基づく実行可能なLLMエージェントスキルの進化的開発
GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)を臨床診断に活用する際、現在のシステムはガイドラインのテキストを検索するか、学習段階で吸収するだけで、実際のルール実行には至っていません。この課題に対応するため、研究チームはGuideSkillという外部推論レイヤーを開発しました。これは疾患固有の診断基準を実行可能な関数にコンパイルし、段階的な診断支援スコアを返すシステムです。
GuideSkillには2つのバージョンがあります。GuideSkill-Zeroはガイドラインから直接初期化され、GuideSkill-Evoは症例と診断のペアを使用してスキルを洗練し、欠落している診断を追加します。推論時には、LLMが鑑別診断を提案し、各スキルが必要とする特徴を特定してから、その順位付けと実行されたスキルスコアを融合させます。
4つのベンチマークと4つのバックボーンにわたる評価結果は顕著です。GuideSkill-Zeroはガイドラインベースの検索拡張生成(RAG)と比較して、マクロ平均精度を平均13.45%向上させました。GuideSkill-Evoはすべてのバックボーンでマクロ平均精度が最高となり、直接推論と比較して相対的に18.49%の改善を達成し、金標準スキルカバレッジを56.5%から99.5%に増加させています。Qwen3.5-9Bでは、バックボーンを更新することなく最強のパラメータ更新ベースラインを11.16%上回りました。
専門家による評価では、GuideSkillが臨床的に健全で広く受け入れられるスキルを生成することが確認されました。初期化されたスキルと進化したスキルの両方が信頼性が高く、実践的に意味のあるものであることが示唆されています。これらの結果から、実行可能なスキルはモデル非依存のメカニズムとして、ガイドラインから導出された手順と症例から導出された診断パターンを組み合わせるのに有効であることが裏付けられました。