arXiv:2607.25239cs.CV2026-07

测试语言引导追踪在不同视觉条件下的鲁棒性,提出新基准与稳定方法。

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

论文配图:CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking
图 1 · 摘自论文原文
  • 构建跨域语言追踪基准,涵盖真实与数字孪生数据。
  • 域偏移使追踪性能显著下降,主因是表达引导的时序关联不稳。
  • 提出查询中心自适应框架,提升跨域追踪稳定性,适合关注视觉迁移的研究者。

参照多目标追踪(RMOT)通过自然语言表达定位目标轨迹,实现从类别驱动感知到语言引导理解的跃迁。尽管近期取得进展,现有研究大多局限于同域设置,未探索语言引导追踪在不可避免的视觉域偏移下的鲁棒性。本文提出跨域参照多目标追踪(CD-RMOT),评估在标注源域训练的模型能否在具有不同视觉条件的未标注目标域中可靠跟随自然语言表达。为此,我们构建了CD-RMOT-Bench,一个统一基准,融合真实清晰域追踪数据、对齐的数字孪生变体及真实恶劣域视频,支持受控天气/视角变化分析和真实-合成域间迁移评估。进一步提出查询中心自适应(QCA)框架,旨在稳定连接视觉轨迹与语言表达的查询空间。大量实验表明,域偏移严重损害RMOT性能,失败并非仅源于检测错误,更关键的是表达引导的时序关联与目标选择不稳定。QCA建立强基线,而CD-RMOT-Bench为跨视觉域的鲁棒语言引导追踪开辟新方向。

原文摘要 · Abstract (English)

Referring multi-object tracking (RMOT) extends tracking from category-driven perception to language-guided understanding by grounding object trajectories in natural-language expressions. Despite recent progress, existing RMOT studies are largely conducted under in-domain settings, leaving the robustness of language-conditioned tracking under inevitable visual domain shifts unexplored. In this paper, we study Cross-Domain Referring Multi-Object Tracking (CD-RMOT), a new and challenging problem that evaluates whether an RMOT model trained on a labeled source domain can reliably follow natural-language expressions in an unlabeled target domain with different visual conditions. To support systematic study, we construct CD-RMOT-Bench, a unified benchmark that combines real clear-domain referring tracking data, aligned digital-twin variants, and real adverse-domain videos. CD-RMOT-Bench enables both controlled weather/viewpoint shift analysis and realistic synthetic-real transfer evaluation under a shared RMOT protocol. Further, we provide a Query-Centric Adaptation (QCA) framework, designed to stabilize the query space that bridges visual trajectories and referring expressions. Extensive experiments reveal that domain shifts severely degrade RMOT performance, where the failure is not merely caused by object detection errors but more critically by unstable expression-conditioned temporal association and target selection. QCA establishes a strong baseline, while CD-RMOT-Bench opens a new direction for robust language-guided tracking across visual domains.

多目标追踪语言引导跨域迁移基准测试

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。