arXiv (ML)AI
AI取引:技術的市場分析におけるLLMの評価
AI Trading: Evaluating Large Language Models for Technical Market Analysis
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
金融市場は複雑で多様な情報環境を備えており、大規模言語モデル(LLM)がこうした環境での情報処理に強力なツールとして注目されています。arXivに発表された最新の研究論文では、GPT-4 Turbo、Claude 3 Opus、Gemini 1.5 Pro、Llama 3 70B、そしてドメイン特化型のFinGPTという5つの主要なLLMが技術的市場分析能力に関してどのように機能するかを、体系的かつ比較的に評価しています。
この研究では4つの構造化されたタスクを通じてLLMの性能を測定しました。ローソク足パターン認識、買いシグナル生成、売りシグナル生成およびホールドシグナル生成、シミュレーション実行パイプラインを通じたシグナル品質のバックテスト、そして財務報告書の理解という各タスクです。評価には、シャープレシオ、最大ドローダウン、ソルティーノレシオ、情報係数、F1スコア、BLEUスコアなどの厳密な定量的指標が採用されました。
バックテスト結果によると、GPT-4 Turboは汎用モデルの中で最高の年間リターンとシャープレシオを達成し、FinGPTはドメイン特化的ファインチューニングにより競争力のあるリスク調整済みパフォーマンスを示しました。両モデルともテスト条件下ではS&P 500のパッシブベンチマークを上回る成績を収めています。しかし研究では、全てのモデルに共通した問題点も明らかになりました。数値幻覚、コンテキストウィンドウの制限、そして横ばい市場でのパフォーマンスのばらつきなどです。研究者らは、LLMがAI取引システム内で真の可能性を持つ一方で、堅牢な展開にはタスク分解の工夫、厳密なバックテスト手法、ドメイン対応型ファインチューニング戦略が必要であると結論付けています。