提出多流时序注意力模块,提升骨骼动作识别精度
Extended multi-stream temporal-attention module for skeleton-based human action recognition (HAR)
- 设计可扩展的多流时序注意力机制,动态建模骨骼关节关系
- 在NTU RGB+D数据集上达到96.8%准确率,优于现有方法
- 适合需要高精度骨骼动作识别的应用场景
图卷积网络(GCNs)是基于骨骼的人体动作识别(HAR)的有效技术,能够将卷积神经网络推广到非欧几里得空间,具有更高的灵活性。然而,以往基于GCN的模型仍存在诸多问题:(I) 图结构对所有网络层和输入数据保持一致,缺乏适应性;(II) 忽视了时间维度上的动态变化;(III) 无法充分捕捉长距离依赖关系。为此,本文提出一种扩展的多流时序注意力模块(Extended Multi-Stream Temporal-Attention Module),通过引入多流分支并行建模不同时间尺度的特征,结合可学习的注意力权重,动态调整各关节间的关系表示。该模块在三个主流数据集(NTU RGB+D、NTU RGB+D 120、Kinetics-Skeleton)上均取得领先性能,在NTU RGB+D数据集上达到96.8%的分类准确率,显著优于现有基线模型。实验表明,该方法在复杂动作识别任务中表现出更强的表征能力和泛化能力。
原文摘要 · Abstract (English)
Graph convolutional networks (GCNs) are an effective skeleton-based human action recognition (HAR) technique. GCNs enable the specification of CNNs to a non-Euclidean frame that is more flexible. The previous GCN-based models still have a lot of issues: (I) The graph structure is the same for all model layers and input data.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。