arXiv (AI)AI
DeepLens診断エージェント:小規模推論モデルがエージェント的ワークフロー設計により最先端LLMと競合可能に
DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
医療診断は事実の抽出、知識の参照、鑑別診断の生成、そして説明付きの最適な診断選択という複数段階のプロセスである。最先端のLLMは汎用性に優れているが、単一のプロンプトでは診断推論が脆弱になりやすい。研究チームが提示するDeepLens診断エージェントは、小規模医療推論モデル(JSL Medical Small 7B v2)と検索拡張生成(RAG)を中心とした5段階のパイプラインで、モデル能力に規律のあるプロセス制約を組み合わせたものである。このパイプラインは構造化された臨床情報の抽出、規律のある検索、制約付き候補生成、明示的なエビデンス三角測量、監査可能な最終決定を順序立てて実行する。
915ケースのDiagnosisArenaベンチマークでは、エージェントが60.14%のトップ1診断精度を達成し、小~中規模モデルの中で最高水準となった。同じモデルをエージェントワークフローなしで使用した場合は23.99%の精度に留まり、ワークフロー設計だけで36ポイント以上の向上を実現した。これは標準医療ベンチマークで88.2%の性能を持つモデルであっても、不確実性下での診断推論には知識想起以上のものが必要であることを示している。
コスト効率の面でも顕著な優位性がある。エージェントはケースあたり0.0072ドル(A100で24Kトークン)、24秒のレイテンシーで動作し、Claude Sonnet 4.5(0.0110ドル)とGemini 3.1 Pro(0.0128ドル)より35~45%低コストでありながら、前者を9.70ポイント、後者を9.17ポイント上回る性能を発揮している。ワークフロー制約がパラメータ数やAPI費用を補うことができることを実証している。
さらに重要な点として、このパイプラインは構造化された中間生成物を産出し、各段階が検査可能で誤差特定をサポートする。医療診断のような高リスク環境では、ベンチマーク性能と同様に追跡可能性、再現性、監査可能なエビデンスが重視される。この透明性と説明責任の実現こそが、実世界への実装において最も価値のある特性となるのである。