通过动态停止机制提升大模型集成推理准确率,避免过度讨论导致性能下降。
Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals

- 基于证据累积实现自适应停机,早期确认共识,碎片化时启用全局频率回退。
- 在GPQA-Extended上达成39.5个百分点的路由差距,AIME上右墙准确率达98.3%。
- 揭示了注入式方法存在先升后降的推理轨迹,为模型优化提供新思路。
大语言模型集成可提升推理准确性,但存在性能上限,超出后进一步讨论反而降低准确率。本文提出DASE(Deliberative Adaptive Stopping Ensemble),一种迭代集成推理的自适应停止策略,能早期识别真实共识,并在证据分散时采用全局频率作为回退机制。主要贡献包括:(1) DASE生成的提交型路由划分在多个基准上表现良好,与文本化单次调用置信度互补。在GPQA-Extended(N=546,70B集成)上,路由差距达39.5个百分点(右墙81.1% vs. 左墙41.5%);在AIME 2010-2023(N=261,120B集成,3种子)上,右墙提交准确率达98.3%,相比左墙72.8%(25.5个百分点差距),与Opus 4.6 Standard文本置信度在相同覆盖下统计无差异(p=0.873),二者路由决策分歧率达37%。(2) 自适应停机是提升准确率的关键,而非注入带宽。在AIME-300上,带宽仅贡献0.3个百分点(不显著);在GPQA-Extended 120B层级,稀疏注入(约15词/工作节点/轮次)实现70.9%准确率,路由差距30.7个百分点;密集注入(约600字符/工作节点/轮次)虽达72.2%准确率,但右墙覆盖率减半,路由差距缩窄至18.9个百分点。(3) 注入方法表现出倒U型的准确率-推理轨迹,该模式具有假设生成价值。
原文摘要 · Abstract (English)
Large Language Model ensembles improve reasoning accuracy, but only up to a performance boundary beyond which additional deliberation degrades accuracy. We introduce DASE (Deliberative Adaptive Stopping Ensemble), a stopping heuristic for iterative ensemble deliberation that commits early on genuine consensus and applies a global-frequency fallback on fragmented evidence. We make three contributions. (1) DASE produces a commit-type routing partition that generalises across benchmarks and is complementary to verbalized single-call confidence. On GPQA-Extended (N=546, 70B ensemble), the partition yields a 39.5 pp routing gap (right-wall 81.1% vs. left-wall 41.5%). On AIME 2010-2023 (N=261, 120B ensemble, 3 seeds), right-wall commits reach 98.3% accuracy vs. left-wall 72.8% (25.5 pp gap), statistically equivalent to Opus 4.6 Standard verbalized confidence at matched coverage (25.7 pp gap; bootstrap p=0.873); the two mechanisms disagree on 37% of routing assignments. (2) Adaptive stopping, not injection bandwidth, drives accuracy. On AIME-300, bandwidth accounts for only 0.3 pp (ns). On GPQA-Extended at the 120B tier, sparse injection ($\approx15$ tokens/worker/round) achieves 70.9% with a 30.7 pp routing gap; dense injection ($\approx600$ chars/worker/round) achieves 72.2% but with halved right-wall coverage and a narrower 18.9 pp gap. (3) Injection-based methods exhibit an inverted-U accuracy-vs-inference trajectory; this pattern is hypothesis-generating.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。