基于原子行动的知识引导解耦用于动作识别
复杂场景中的动作识别通常涉及多个细粒度动作的并发,难以建模动作的内部结构。现有大多数方法依赖整体表征,难以捕捉细微交互和细粒度语义。本文提出KDA方法,利用细粒度语义知识,通过大语言模型将动作标签分解为原子动作,提供明确的时空语义。知识注入模块(KIM)将原子动作知识整合进视频特征,知识解耦模块(KDM)基于此进行更精准的语义引导,且设计了知识解耦损失(KD Loss)以强化解耦效果。大量实验表明,KDA提升了特征判别力,在多标签动作识别基准上达成最先进表现,且KIM与KDM模块易于集成,具备较强通用性。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。