提出自适应预处理方法,提升办公室视频活动识别在不同环境下的泛化能力。
Domain Generalization for Improved Human Activity Recognition in Office Space Videos Using Adaptive Pre-processing
- 设计三种通用预处理技术,增强视频编码器对环境变化的鲁棒性。
- 在未见领域上显著提升准确率、精确率、召回率和F1分数。
- 适用于需跨场景部署的智能监控与办公自动化系统。
自动视频活动识别在安防、医疗和机器人等领域至关重要。然而,当训练与测试数据来自不同域时,识别难度增大。域泛化对适应未知域尤为关键。本文聚焦于办公环境中的活动识别,面对环境多样性挑战。提出三种可应用于任意视频编码器的预处理技术,显著提升模型对环境变化的鲁棒性。实验表明,结合MViT等先进视频分类模型与所提方法,在未见域上的表现优于现有域自适应技术,大幅提高准确率、精确率、召回率及F1分数,验证了该方法在异构视频数据场景下的强适应性,为构建更可靠的跨域视频活动识别系统奠定基础。
原文摘要 · Abstract (English)
Automatic video activity recognition is crucial across numerous domains like surveillance, healthcare, and robotics. However, recognizing human activities from video data becomes challenging when training and test data stem from diverse domains. Domain generalization, adapting to unforeseen domains, is thus essential. This paper focuses on office activity recognition amidst environmental variability. We propose three pre-processing techniques applicable to any video encoder, enhancing robustness against environmental variations. Our study showcases the efficacy of MViT, a leading state-of-the-art video classification model, and other video encoders combined with our techniques, outperforming state-of-the-art domain adaptation methods. Our approach significantly boosts accuracy, precision, recall and F1 score on unseen domains, emphasizing its adaptability in real-world scenarios with diverse video data sources. This method lays a foundation for more reliable video activity recognition systems across heterogeneous data domains.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。