arXiv:2608.30233cs.CV2026-08中稿 · ACM MM 2026

提升细粒度语义与空间区分能力,解决多目标混淆问题

Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

论文配图:Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding
图 1 · 摘自论文原文
  • 通过空间引导交叉注意力分离细粒度视觉特征
  • 构建实例中心密度图实现空间域显式分离
  • 在10个数据集上超越现有方法,适合复杂场景定位

广义视觉定位(GVG)任务旨在基于指代表达在图像中定位目标,扩展了经典视觉定位范式,涵盖多目标和非目标场景。以往方法通常依赖全局语义匹配或粗粒度区域交互进行定位,其判别线索主要来自句子级语义或区域上下文。在复杂的多目标场景中,此类方法容易混淆视觉相似的目标,难以建立稳定的实例级决策边界。为此,本文提出一种新的语义-空间区分增强(SSDE)框架,旨在提升细粒度语义与空间定位的判别能力,增强跨模态理解与实例级定位性能。具体而言,为提升查询表示在细粒度层面的语义区分性,提出语义区分增强(SeDE)模块,利用空间引导的交叉注意力分离目标相关视觉属性,并将其与文本主体语义融合;为进一步强化被指代目标的空间区分性,引入空间区分增强(SpDE)模块,建模实例中心密度图以刻画目标的空间分布,并以此作为辅助监督信号,在空间域显式构建实例分离结构。大量实验表明,SSDE在十个数据集上均实现了优于现有方法的性能,覆盖经典与广义视觉定位任务。

原文摘要 · Abstract (English)

Generalized Visual Grounding (GVG) task aims to localize targets in an image based on referring expressions, extends the classical visual grounding paradigm by integrating multi-target and non-target scenarios. Previous methods typically rely on global semantic matching or coarse-grained region interactions for localization, where the discriminative cues are primarily derived from sentence-level semantics or regional context. In complex multi-target scenarios, such approaches tend to confuse visually similar targets, making it difficult to establish stable instance-level decision boundaries. To address these limitations, this paper proposes a novel Semantic-Spatial Discriminability Enhancement (SSDE) framework for generalized visual grounding, which aims to enhance the discriminative ability on fine-grained semantics and spatial localization, improving both cross-modal understanding and instance-level grounding. Specifically, to enhance the semantic discriminability of query representations at the fine-grained level, we propose a Semantic Discriminability Enhancement (SeDE) module, which leverages spatially guided cross-attention to disentangle fine-grained target-relevant visual attributes and integrates them with the textual subject semantics. Furthermore, to strengthen the spatial discriminability of the referred targets, we introduce a Spatial Discriminability Enhancement (SpDE) module, which models an instance center density map to characterize the spatial distribution of targets, and explicitly constructs instance separation structures in the spatial domain by employing them as an auxiliary supervision signal. Extensive experiments show that SSDE achieves superior performance on ten datasets across both classic and generalized visual grounding tasks.

视觉定位语义区分空间建模

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。