arXiv:2605.17907cs.CVcs.AI2026-05中稿 · ICML

一个模型搞定任意传感器间感知信息互译,无需重新训练。

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

论文配图:One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
图 1 · 摘自论文原文
  • 用可动态生成的翻译器处理不同传感器特征,避免重复训练。
  • 在真实和模拟场景中均超越现有方法,性能提升显著。
  • 适合跨厂商合作的自动驾驶系统,解决数据隐私难题。

通过共享中间特征,协同感知可突破单个设备的探测限制,但现实中特征模态异构仍是有效融合的关键障碍。现有方法如直接适配或协议转换通常需为新模态训练适配器,并常需额外微调或再训练,成本高且受模型与数据隐私限制,难以在多厂商间推广。为此,我们提出UniTrans——一种通用任意模态间特征翻译模型,可即时生成任意模态间的翻译器。UniTrans 预训练一组翻译专家参数,并学习其组合系数作为源到目标模态映射的函数。该映射在模态内隐空间中计算,由内隐编码器从单帧中间特征提取出模态特异但场景不变的代码,实现零样本翻译。在OPV2V-H和DAIR-V2X数据集上的实验表明,UniTrans在模拟与真实场景中均持续优于当前最优方法,仅凭一个通用模型即可实现高效任意模态转换。

原文摘要 · Abstract (English)

By sharing intermediate features, collaborative perception extends each agent's sensing beyond standalone limits, but real-world feature modality heterogeneity remains a key barrier to effective fusion. Most existing methods, including direct adaption and protocol-based transformation, typically rely on training adapters for newly emerging feature modalities and often require additional retraining or fine-tuning. Such repeated training is costly and is often infeasible across manufacturers due to model and data privacy constraints, limiting real-world scalability. To address this issue, we propose UniTrans, a universal any-to-any feature modality translation model that instantiates translators on the fly for arbitrary modalities. UniTrans pretrains a bank of translator expert parameters and learns their combination coefficients as a function of source-to-target modality mapping. The mapping is measured in a modality-intrinsic latent space, where an intrinsic encoder extracts modality-specific yet scene-invariant codes from single-frame intermediate features, enabling UniTrans to instantiate translators in a zero-shot manner. Experiments on OPV2V-H and DAIR-V2X demonstrate that UniTrans consistently outperforms state-of-the-art methods in both simulated and real-world settings, enabling efficient any-to-any translation through a universal model. The code is available at https://github.com/CheeryLeeyy/UniTrans.

协同感知模态翻译自动驾驶零样本

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。