arXiv:2505.21918cs.LGcs.AI2025-05

用改进的Transformer处理多维传感器数据,提升人体动作识别准确率。

Self-supervised Learning Method Using Transformer for Multi-dimensional Sensor Data Processing

  • 将多维数值数据通过线性层嵌入,结合分箱预处理和输出层线性变换
  • 在五个数据集上相比原版Transformer提升10%-15%准确率
  • 适合做传感器信号分析与动作识别的研究者参考

我们开发了一种基于Transformer架构的深度学习算法,用于人体动作识别,输入为传感器信号。受自然语言处理中预训练语言模型启发,构建了基于Transformer的预训练模型,以提升下游动作识别任务性能。尽管可直接使用原始Transformer,本文提出一种增强型n维数值处理Transformer,包含三个关键设计:通过线性层对n维数值数据进行嵌入、基于分箱的预处理方法,以及输出层的线性变换。在五个不同数据集上评估了所提模型的有效性。结果表明,相比标准Transformer,本模型在准确率上提升了10%至15%。

原文摘要 · Abstract (English)

We developed a deep learning algorithm for human activity recognition using sensor signals as input. In this study, we built a pretrained language model based on the Transformer architecture, which is widely used in natural language processing. By leveraging this pretrained model, we aimed to improve performance on the downstream task of human activity recognition. While this task can be addressed using a vanilla Transformer, we propose an enhanced n-dimensional numerical processing Transformer that incorporates three key features: embedding n-dimensional numerical data through a linear layer, binning-based pre-processing, and a linear transformation in the output layer. We evaluated the effectiveness of our proposed model across five different datasets. Compared to the vanilla Transformer, our model demonstrated 10%-15% improvements in accuracy.

Transformer动作识别传感器数据

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。