arXiv:2606.27965cs.SDeess.AS2026-06中稿 · Interspeech 2026

用语法约束解析长音频层次结构,无需标签即可生成可解释的活动分割。

Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition

论文配图:Grammar-Guided Hierarchical Parsing for Long-form Audio Activity Recognition
图 1 · 摘自论文原文
  • 构建活动语法模型,融合层级组合与时间顺序约束
  • 在MultiAct数据集上编辑得分提升,且结果具时序一致性
  • 适合无子活动标签的长音频分析任务

长时音频具有内在层次结构:细粒度事件构成子活动,子活动再组成高层活动。以往方法通常分层建模,导致跨层不一致,且需多级标注。本文将问题建模为从事件证据中进行层次解析:给定带有类别后验的概率事件片段,推断一个满足顺序一致性的“活动-子活动-事件”解析树。提出层次活动语法(Hierarchical Activity Grammar),编码层级组合与时间顺序约束,并通过语法引导解码,融合事件证据与语法先验。由此生成的时间对齐解析树,可直接导出子活动分割与活动分类结果,训练无需子活动或活动标签。在长时多活动音频数据集MultiAct上的实验表明,该方法显著提升了时间顺序一致性(编辑得分),并生成可解释的层次结构。

原文摘要 · Abstract (English)

Long-form audio exhibits an inherent hierarchy: fine-grained events form sub-activities, which in turn constitute higher-level activities. Prior work often models these levels separately, leading to cross-level inconsistencies and requiring supervision at multiple levels. We formulate the problem as hierarchical parsing from event-level evidence: given detected event segments with class posteriors, we infer an order-consistent Act-Sub-Event parse tree. We propose Hierarchical Activity Grammar, encoding hierarchical composition and temporal-order constraints, and perform grammar-guided decoding that combines event evidence with a grammar prior. This yields a temporally grounded parse tree from which sub-activity segmentation and activity classification are derived, without requiring sub-activity or activity labels for training. Experiments on the long-form MultiAct audio dataset demonstrate improved temporal-order consistency (Edit score) and produces interpretable hierarchies.

音频理解层次解析语法约束无监督

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。