arXiv (AI)AI
AnovaX:LLM計画機能を備えた多機能ローカル音声アシスタント
AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
デスクトップ音声アシスタント市場は依然としてクラウドベースのパイプラインに支配されており、ユーザーの音声データをサーバーに送信して限定的なスキルセットを提供する仕組みが主流となっています。こうした環境の中、研究チームが発表したAnovaXは、ユーザーのコンピュータ上で完全にローカルで動作する小型アシスタントであり、デスクトップそのものを行動の対象として扱う革新的なアプローチを採用しています。
AnovaXのシステムは、単一のPythonプロセスで複数のコンポーネントを統合しており、ウェイクワード認識機能、音声処理パイプライン、JSON形式のツール呼び出しプランを生成するLLMプランナー(Gemini)、ホワイトリスト・ブラックリスト方式のセーフティレイヤー、そして計画を型付き子エージェントに翻訳する多機能オーケストレーターで構成されています。各ツールはAppAgent、TypingAgent、BrowserAgentなど専門化されたエージェントクラスに対応し、それぞれがタイムアウト、リトライポリシー、共有リソースロックを備えています。システムの特徴的な機能として、適応的なリカバリーループが核となるステップの失敗に対応し、ReAct風のコンパクトなプロンプトを使用してGeminiのレイテンシーを読み取り専用ツールの推測実行で隠蔽します。
加えて、付属するFlaskサーバーはローカルWiFi経由でスマートフォンからのリモート操作を可能にし、あらゆるエージェントのライフサイクルイベントをリアルタイムでスマートフォンに反映させます。ユーザーはMJPEG形式でノートパソコン画面をストリーミング表示でき、リモートコマンドが実行される様子を別室のスマートフォンから監視することができます。
このプロジェクトはSiriやAlexaとの競争を目指すというより、数千行程度のシンプルなコードでアプリケーション起動、テキスト入力、検索実行、複数タスクの並行処理、単一ステップの失敗からの回復、そしてLLMがキーボードに接触することなくスマートフォンから完全にデバイスを制御できることを実証することに焦点を当てています。