构建大规模驾驶交互数据集,支持自动驾驶多智能体行为分析与语言指令训练。
An interactive enhanced driving dataset for autonomous driving
- 从五个自然驾驶数据集构建交互导向的大型数据集,覆盖多种典型交通场景。
- 包含731万段交互片段,666万个多智能体交互案例,每段配有交互强度与效率指标。
- 提供重构的俯视视频、结构化语义和多轮问答,适用于复杂交互建模与评估。
驾驶交互数据对训练和评估自动驾驶视觉-语言-动作(VLA)模型至关重要,但现有数据集交互样本稀疏且轨迹、视觉输入与语言标注对齐较弱。本文提出交互增强型驾驶数据集(IEDD),基于五项自然驾驶轨迹数据集(Lyft Level 5、Waymo、nuPlan、INTERACTION、SIND)构建,包含731万条以车辆为中心的交互片段,其中666万条涉及多智能体交互,涵盖对向、跟车、变道和交叉等典型场景。每段均配有基于轨迹的交互强度与效率度量。在此基础上,IEDD-VQA进一步提供轨迹重建的俯视图视频、结构化交互语义及多轮问答对。该数据集可支持交互挖掘、长尾场景分析、VLA指令微调以及感知、行为描述、物理量化与反事实推理的分层评估。
原文摘要 · Abstract (English)
Driving interaction data are important for training and evaluating autonomous drivingVision-Language-Action (VLA) models, but existing datasets contain limited denseinteraction samples and weak alignment between trajectories, visual inputs, and languageannotations. This work presents the Interactive Enhanced Driving Dataset (IEDD), alarge-scale interaction-oriented dataset constructed from five naturalistic trajectory datasets:Lyft Level 5, Waymo, nuPlan, INTERACTION, and SIND. IEDD contains 7.31 millionego-centric interaction segments, including 6.66 million multi agents cases, covering head-on,car-following, merging, and crossing interactions. Each segment is associated withtrajectory-derived interaction metrics describing interaction intensity and efficiency. Based onthese annotations, IEDD-VQA further provides trajectory-reconstructed BEV videos,structured interaction semantics, and multi-turn question-answer pairs. The dataset cansupport interaction mining, long-tail scenario analysis, VLA instruction tuning, andhierarchical evaluation of perception, behavior description, physical quantification, andcounterfactual reasoning.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。