arXiv:2606.31096cs.CV2026-06中稿 · ECCV

融合雷达与相机的稀疏感知框架,提升高速自动驾驶远距离3D检测性能。

Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving

论文配图:Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving
图 1 · 摘自论文原文
  • 用高斯原语结合稀疏鸟瞰图特征,融合多模态细节与场景上下文。
  • 在TruckScenes数据集上实现3.0点的NDS提升,精度领先且推理速度快。
  • 适合需要远距离精准感知的自动驾驶系统研发与部署。

长距离3D目标检测对高速自动驾驶至关重要,但现有雷达-相机融合方法在远距离表现受限。基于鸟瞰图(BEV)的方法虽能捕捉场景级上下文,但计算量剧增且丢失细粒度目标信息;基于查询的方法效率高但缺乏场景全局理解。时间融合还需处理稀疏远距离观测的多帧累积及快速移动物体的运动建模。本文提出Horizon3D,一种面向长距离3D感知的稀疏雷达-相机融合框架,通过高斯原语与稀疏BEV特征结合实现感知。该方法利用关键点引导的高斯初始化,在雷达与相机估计的目标关键点处构建高斯原语,经对象中心稀疏融合后投影至BEV平面,融合对象级细节与稀疏雷达BEV上下文。进一步提出双路径时序融合机制:在BEV路径中积累场景级时序信息,在高斯路径中传播对象级运动特征。在TruckScenes数据集上的实验表明,Horizon3D达到当前最优的雷达-相机3D检测性能。验证集上相较前最佳方法提升+3.0 NDS和+1.6 mAP,同时保持竞争力的推理速度。

原文摘要 · Abstract (English)

Long-range 3D object detection is critical for safe autonomous driving at highway speeds, yet existing radar-camera fusion methods remain limited at extended ranges. BEV-based methods capture scene-level context but incur rapidly growing computation and often lose fine-grained object detail, while query-based methods are efficient but provide limited scene-level context. Temporal fusion further requires both multi-frame accumulation for sparse distant observations and object-level motion modeling for fast-moving objects. We propose Horizon3D, a sparse radar-camera fusion framework for long-range 3D object detection that combines Gaussian primitives with sparse BEV features. Horizon3D initializes Gaussian primitives at radar- and camera-estimated object keypoints using Keypoint-Guided Gaussian Initialization, refines them through Object-Centric Sparse Fusion, and splats them onto the BEV plane to fuse object-level detail with sparse radar BEV context. It further introduces Dual-Path Temporal Fusion, which aggregates temporal cues through a BEV path for scene-level accumulation and a Gaussian path for object-level motion propagation. Experiments on TruckScenes show that Horizon3D achieves state-of-the-art radar-camera 3D detection performance. On the validation set, it outperforms the previous best method by +3.0 NDS and +1.6 mAP while maintaining competitive inference speed.

3D检测多模态融合自动驾驶稀疏感知

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。