arXiv:2606.11907cs.IR2026-06中稿 · KDD

提出一种高效自适应检索截断方法,让AI回答更准且快。

Tail-Aware Adaptive-k: Query-Adaptive Context Selection for Retrieval-Augmented Generation

论文配图:Tail-Aware Adaptive-k: Query-Adaptive Context Selection for Retrieval-Augmented Generation
图 1 · 摘自论文原文
  • 基于局部验证的几何检测,定位相关性变化的关键点
  • 在三个数据集上接近最优检索效果,效率提升数个数量级
  • 无需训练,适配多种模型和压缩维度,适合实际部署

自适应上下文选择对检索增强生成(RAG)系统至关重要,因固定Top-K检索在查询依赖和重尾相似度分布下表现不佳。现有基于极值理论(EVT)的方法全局应用,计算成本高且统计不稳定。本文提出无训练的尾部感知自适应k(TAA-k)框架,通过局部验证策略实现EVT的实用化。核心洞察是排序相似度曲线呈现陡峭-平坦-陡峭的特征模式,反映从相关性主导到噪声主导的转变。TAA-k利用该几何结构通过拐点检测确定候选区域,再在此窗口内进行基于EVT的拟合优度检验,以验证尾部行为的起始点。该粗到精设计将复杂度从O(N²M)降至O(√(N log N)·M),同时保持统计严谨性。在单调似然比假设下,TAA-k可稳定输出对应最早噪声主导位置的查询自适应截断点。在WebQuestions、2WikiMultiHopQA和MuSiQue上的实验表明,TAA-k达到接近最优的检索质量(F1仅差2-3%),相比全局EVT方法效率提升多个数量级,且在不同嵌入模型和压缩维度下均具鲁棒性。

原文摘要 · Abstract (English)

Adaptive context selection is critical for retrieval-augmented generation (RAG) systems, as fixed Top-K retrieval fails under query-dependent and heavy-tailed similarity distributions. While Extreme Value Theory (EVT) offers a principled framework for adaptive truncation, existing approaches apply EVT globally across the entire ranked list, incurring prohibitive computational costs and statistical instability. We propose Tail-Aware Adaptive-k(TAA-k), a training-free framework that operationalizes EVT through a localized validation strategy. The key insight is that ranked similarity curves exhibit a characteristic steep--flat--steep pattern reflecting a transition from relevance-dominated to noise-dominated regimes. TAA-k exploits this geometric structure via knee detection to identify a compact candidate region, then applies EVT-based goodness-of-fit testing within this window to validate the onset of tail behavior. This coarse-to-fine design reduces computational complexity from O(N^2M) to O(sqrt{N\log N}*M) while maintaining statistical rigor. Under mild monotone likelihood ratio assumptions, TAA-k yields a stable, query-adaptive cutoff corresponding to the earliest noise-dominated position. Experiments on WebQuestions, 2WikiMultiHopQA, and MuSiQue demonstrate that TAA-k achieves near-oracle retrieval quality (F1 within 2-3% of oracle) with orders-of-magnitude efficiency gains over global EVT methods, while maintaining robustness across embedding models and compression dimensions.

RAG检索优化极值理论

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。