arXiv (CV)AI
TITLE_JA: ミリ波レーダーで人間行動を理解する基盤モデル:ポーズ誘導型運動表現学習
Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
大規模言語モデル(LLM)エージェントが物理環境で人間の行動を認識する必要が高まっています。ミリ波(mmWave)レーダーはプライバシーに優しいコンタクトレス感知モダリティを提供しますが、レーダー観測値を言語と整列させることは従来困難でした。既存のレーダー言語モデルは合成データに依存するか、人体構造と動作に対する明示的な教師信号が不足していました。
本研究は「mmMind」というレーダー言語モデルを提案し、3次元ポーズデータを訓練時のみの教師信号として活用します。時空間レーダーエンコーダは身体構成と運動ダイナミクスを捉えるように事前学習され、その後ポーズヘッドを除去することで推論時にはレーダーのみが必要になります。学習されたレーダー表現はLLMと整列され、行動キャプショニングと時空間質問応答に利用されます。
研究チームは同時に「mmMind-Bench」という実世界ベンチマークも構築しました。これは23人の参加者から7つの室内環境で収集された17.9時間の記録を含むmmWave言語ベンチマークです。キャプショニング、質問応答、未見動作への汎化性能を評価した実験では、mmMindが既存のレーダー言語ベースライン手法を一貫して上回り、アブレーション研究はポーズ誘導型事前学習の重要性を確認しました。これにより、プライバシー保護と行動理解の両立に向けた新たな道が開かれました。