用弱监督提升跨视角多目标追踪,仅靠类别标签就能实现精准跟踪。
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking

- 利用大模型生成伪标签,分两阶段优化跨摄像头对象关联。
- 在仅10%额外参数下达到当前最优弱监督性能。
- 适合缺乏精细标注数据的智能监控场景应用。
跨视角指代多目标追踪(CRMOT)旨在通过自然语言描述,在多个摄像头视图中追踪多个具有全局一致身份的对象。尽管已有进展,现有方法仍严重依赖昂贵的帧级空间标注和跨视角身份监督。为减少此类依赖,我们探索在弱监督下利用基础模型的能力。然而实证研究显示,直接使用SAM2、SAM3等基础模型,即使进行任务特定修改,也无法准确理解指代表达或保持跨视图身份一致性。但它们在生成可靠对象轨迹片段方面仍有效,可作为伪监督信号。因此,我们将基础模型重新定位为伪标签生成器,提出一种两阶段弱监督CRMOT框架,仅需物体类别标签作为粗粒度监督。第一阶段设计了基于亲和力的跨视角重提示策略,以优化并关联SAM3生成的轨迹片段,生成可靠的跨视图伪标签用于后续训练。第二阶段引入ViewSAM,一个基于SAM2构建的CRMOT模型,显式建模视图感知的跨模态语义。通过将视图引起的差异建模为可学习条件,ViewSAM弥合了视图异构视觉观测与视图不变文本表达之间的鸿沟,实现鲁棒的跨视图指代追踪,且仅增加约10%的参数量。大量实验表明,ViewSAM在弱监督条件下达到当前最佳性能,并保持与全监督方法相当的竞争力。
原文摘要 · Abstract (English)
Cross-view Referring Multi-Object Tracking (CRMOT) aims to track multiple objects specified by natural language across multiple camera views, with globally consistent identities. Despite recent progress, existing methods rely heavily on costly frame-level spatial annotations and cross-view identity supervision. To reduce such reliance, we explore CRMOT under weak supervision by leveraging the capabilities of foundation models. However, our empirical study shows that directly applying foundation models such as SAM2 and SAM3, even with task-specific modifications, fails to accurately understand referring expressions and maintain consistent identities across views. Yet, they remain effective at producing reliable object tracklets that can serve as pseudo supervision. We therefore repurpose foundation models as pseudo-label generators and propose a two-stage framework for weakly supervised CRMOT, using only object category labels as coarse-grained supervision. In the first stage, we design an Affinity-guided Cross-view Re-prompting strategy to refine and associate SAM3-generated tracklets across cameras, producing reliable cross-view pseudo labels for subsequent training. In the second stage, we introduce ViewSAM, a CRMOT model built upon SAM2 that explicitly models view-aware cross-modal semantics. By formulating view-induced variations as learnable conditions, ViewSAM bridges the gap between view-variant visual observations and view-invariant textual expressions, enabling robust cross-view referring tracking with only approximately 10% additional parameters. Extensive experiments demonstrate that ViewSAM achieves SOTA performance under weak supervision and remains competitive with fully supervised methods.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。