提出新方法提升视频动作识别在开放场景下的未知动作拒识能力
A Baseline Study and Benchmark for Few-Shot Open-Set Action Recognition with Feature Residual Discrimination
- 设计特征残差判别器,适配复杂视频数据的开放集识别
- 在五个数据集上显著提升未知动作拒识率,同时保持闭集准确率
- 首次构建视频动作识别开放集基准,适合研究少样本与开放世界应用
少样本动作识别(FS-AR)虽表现良好,但常受限于封闭集假设,在真实开放场景中效果不佳。尽管图像领域的少样本开放集识别已较成熟,其向时空视频数据的拓展仍不充分。为此,我们基于特征残差判别器(FR-Disc)提出架构扩展,将先前针对骨骼数据的工作迁移至更复杂的视频域。在五个数据集上的大量实验表明,通用开放集方法仅带来微弱提升,而我们的FR-Disc显著增强未知动作拒识能力,且不牺牲闭集准确率,为FSOS-AR设立了新基准。项目网站、代码与基准已公开:https://hsp-iit.github.io/fsosar/
原文摘要 · Abstract (English)
Few-Shot Action Recognition (FS-AR) has shown promising results but is often limited by a closed-set assumption that fails in real-world open-set scenarios. While Few-Shot Open-Set (FSOS) recognition is well-established for images, its extension to spatio-temporal video data remains underexplored. To address this, we propose an architectural extension based on a Feature-Residual Discriminator (FR-Disc), adapting previous work on skeletal data to the more complex video domain. Extensive experiments on five datasets demonstrate that while common open-set techniques provide only marginal gains, our FR-Disc significantly enhances unknown rejection capabilities without compromising closed-set accuracy, setting a new state-of-the-art for FSOS-AR. The project website, code, and benchmark are available at: https://hsp-iit.github.io/fsosar/.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。