arXiv:2606.07161cs.CV2026-06

通过轨迹级信息聚合,提升监控视频中文本识别的稳定性。

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

论文配图:TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance
图 1 · 摘自论文原文
  • 基于时间与视觉一致性聚类文本轨迹,减少噪声干扰。
  • 融合多模态信息,使识别准确率在4个数据集上全面领先。
  • 适合需要稳定文本识别的智能交通与城市监控场景。

视频文本检测(VTS)在城市监控与智能交通系统中至关重要,可实现对街牌、车辆标识和场景文本的自动识别。然而,由于监控场景中的运动模糊、遮挡和尺度变化等动态因素,帧级识别性能下降。现有方法独立处理每帧,导致序列结果不一致。为此,本文提出TraRA(轨迹级识别聚合),一种即插即用的方法,通过利用时间和多模态一致性,在轨迹层面进行文本识别。TraRA包含两个关键模块:(1)时间聚类,用于整合时空与视觉一致的文本实例以优化噪声轨迹;(2)视觉-语言聚合,采用低秩适配增强的视觉-语言模型,跨帧融合视觉线索与语言上下文。通过在整个文本轨迹上聚合信息,TraRA在复杂监控条件下仍保持鲁棒识别。在四个公开基准(RoadText、BOVText、ArTVideo、ICDAR15)上的实验表明,该方法持续优于当前最优的VTS方法。源代码已开源。

原文摘要 · Abstract (English)

Video Text Spotting (VTS) is essential for urban surveillance and intelligent transportation systems, enabling automated reading of street signs, vehicle markings, and scene text in video streams. However, reliable recognition remains challenging due to dynamic video factors common in surveillance scenarios, including motion blur, occlusion, and scale variation, which degrade frame-level recognition. Existing VTS methods typically perform recognition independently on each frame, leading to inconsistent and inaccurate results across sequences. To address these limitations, we propose TraRA (Trajectory-level Recognition Aggregation for VTS), a plug-and-play method that performs trajectory-level text recognition by leveraging temporal and multimodal consistency. TraRA integrates two key modules: (1) the Temporal Clustering and (2) the Vision-Language Aggregation. The former refines noisy trajectories by grouping temporally and visually coherent text instances, while the latter employs a Low-Rank Adaptation-enhanced Vision-Language model to fuse visual cues with linguistic context across frames. By aggregating information over entire text trajectories, TraRA achieves robust text recognition even under challenging surveillance conditions. Extensive experiments on four public benchmarks, including road and urban scene datasets (RoadText, BOVText, ArTVideo, and ICDAR15), demonstrate that TraRA consistently improves tracking and recognition performance over state-of-the-art VTS methods. The source code is available at https://github.com/trid2912/TraRA.

视频文本识别轨迹聚合监控系统

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。