arXiv:2601.01989cs.CVcs.AI2026-01被引 2

用视觉变压器预测行人意图,提升自动驾驶安全性

VIT-Ped: Visionary Intention Transformer for Pedestrian Behavior Analysis

  • 基于多模态视频的视觉变压器模型,捕捉行人行为细节
  • 在JAAD数据集上达成准确率、AUC和F1-score新纪录
  • 适合自动驾驶中行人行为预测研究者参考

行人意图预测是实现从L3到L4级自动驾驶的关键技术。为理解行人过街行为,需综合考虑多种要素与特征,以提升未来道路安全。本文提出一种基于变压器及视频变压器的不同规模算法,融合多源数据模态。在主流行人行为数据集JAAD上进行评估,各项指标均达到当前最优(SOTA),包括准确率、AUC和F1-score。通过大量消融实验,分析了不同模型设计选择带来的优势。

原文摘要 · Abstract (English)

Pedestrian Intention prediction is one of the key technologies in the transition from level 3 to level 4 autonomous driving. To understand pedestrian crossing behaviour, several elements and features should be taken into consideration to make the roads of tomorrow safer for everybody. We introduce a transformer / video vision transformer based algorithm of different sizes which uses different data modalities .We evaluated our algorithms on popular pedestrian behaviour dataset, JAAD, and have reached SOTA performance and passed the SOTA in metrics like Accuracy, AUC and F1-score. The advantages brought by different model design choices are investigated via extensive ablation studies.

行人预测视觉变压器自动驾驶多模态

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。