arXiv (CV)AI
原子的アクションによる知識誘導型分離:複雑なシーンにおけるアクション認識の精密化
Knowledge-guided Disentanglement with Atomic Actions for Action Recognition
この記事についてAIに質問する →
日本語要約青い用語にマウスを合わせると解説が表示されます
複雑なシーンにおけるアクション認識は、複数の細粒度アクションが同時に発生する状況に直面し、アクションの内部構造をモデル化することが困難となっています。従来の手法の多くは全体的な表現に依存しており、細微な相互作用や細粒度のセマンティクスを捉えるには不十分です。近年、プロンプトベースのアプローチが分離(ディエンタングルメント)を導入していますが、明示的なセマンティック誘導が不足しており、視覚的またはマイク構造的な手がかりのみに基づく手法は粗粒度に留まっています。
本論文で提案されるKDA(Knowledge-guided Disentanglement with Atomic Actions)は、細粒度のセマンティック知識を活用して、アクション表現を強化し、より精密な分離を実現します。具体的には、大規模言語モデル(LLM)を用いてアクションラベルを原子的アクションに分解し、明示的な時空間セマンティクスを提供します。Knowledge Injection Module(KIM)はまず原子的アクション知識をビデオ特徴に統合し、この強化された表現に基づいて、Knowledge Disentanglement Module(KDM)はさらに原子的アクション知識を分離し、アクション分離のための より精密なセマンティック誘導を生成します。
新たに導入されたKnowledge Disentanglement Loss(KD Loss)は、KDM内の知識成分のより明確な分離を促進します。広範な実験により、KDAは特徴判別性を向上させ、マルチラベルアクション認識ベンチマークにおいて最先端の性能を達成することが示されています。さらに、KIMとKDMは他の手法に容易に統合でき、強い汎用性を示しています。