针对语音识别中生僻词识别不准的问题,提出新量化方法提升罕见词表现。
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition

- 通过均衡常见词与生僻词的校准权重,改进模型量化过程
- 在6个数据集上显著降低生僻词错误率,且不牺牲整体性能
- 无需标签或额外训练,适合实体丰富的语音识别场景
数据感知的后训练量化(PTQ)在小规模校准语料上最小化每个词元的重构损失,隐式按词频加权。对于自动语音识别(ASR),这导致尾部敏感风险错配:姓名、数字和领域特定词获得的比例校准量过少。本文提出无标签的尾部感知重构量化(TARQ),通过一种闭式逐层规则 areBAL,使常见词与尾部词的校准质量相等,并结合一致性残差修正。TARQ无需实体标签、无需精选校准集、无需验证解码,也无需额外训练。在八个ASR主干网络和六个数据集上(W4G128),TARQ在不降低整体词错误率的前提下,显著改善罕见词错误率(rare-WER),且跨语料的rare-WER波动最小,并可在无实体监督下迁移到实体密集型基准(ProfASR, ContextASR-Speech-En)。
原文摘要 · Abstract (English)
Data-aware post-training quantization (PTQ) minimizes a per-token reconstruction loss on a small calibration corpus, implicitly weighting positions by their empirical frequency. For \textbf{A}utomatic \textbf{S}peech \textbf{R}ecognition (ASR), this misaligns with tail-sensitive risk: names, numerals, and domain-specific words receive proportionally little calibration mass. We propose \textbf{Tail-Aware Reconstruction Quantization} (\TARQ), a label-free PTQ framework that shifts calibration toward the lexical tail via \textbf{\rareBAL}, a closed-form per-Linear-layer rule equalizing common/tail mass, paired with a metric-consistent residual correction. \TARQ\ requires no entity labels, no curated calibration set, no validation decoding, and no additional training. Across eight ASR backbones and six datasets at W4G128, \TARQ\ improves mean rare-\textbf{W}ord \textbf{E}rror \textbf{R}ate (rare-WER) without an aggregate-WER regression, achieves the lowest cross-corpus rare-WER swing among compared methods, and transfers to entity-rich benchmarks (ProfASR, ContextASR-Speech-En) without entity supervision.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。