通过噪声扰动推理路径,让大模型学会自我怀疑,提升可靠性。
NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning

- 在推理时注入噪声,生成多条不同思考路径
- 路径一致时准确率超95%,错误率从40%-70%降至15%以下
- 无需重训练或改参数,适合现有大模型部署
本文提出NoisyCoconut,一种新型推理时方法,通过操纵大语言模型(LLM)的内部表示来增强其可靠性。不同于需要大量重训练的微调方法,NoisyCoconut直接在推理过程中作用于模型表示,无需重训练。我们不训练模型在潜在空间推理,而是向潜在轨迹注入可控噪声,生成多样化的推理路径。这些路径的一致性提供置信度信号,使模型在不确定时选择不回答。实验表明,该方法在多个推理基准上实现了有效的覆盖-准确率权衡,无需访问训练数据或修改模型参数。当噪声扰动路径达成一致时,错误率从40%-70%降至15%以下,使模型通过选择性拒答在数学推理任务上达到超过95%的准确率。
原文摘要 · Abstract (English)
This paper presents NoisyCoconut, a novel inference-time method that enhances large language model (LLM) reliability by manipulating internal representations. Unlike fine-tuning methods that require extensive retraining, NoisyCoconut operates directly on model representations during inference and requires no retraining. Rather than training models to reason in latent space, we inject controlled noise into latent trajectories to generate diverse reasoning paths. Agreement among these paths provides a confidence signal, enabling models to abstain when uncertain. We demonstrate that this approach achieves effective coverage-accuracy tradeoffs across multiple reasoning benchmarks without requiring access to training data or modification of model parameters. This approach provides a practical pathway to improving the reliability of LLM outputs while maintaining compatibility with existing models. Our experiments show that unanimous agreement among noise-perturbed paths reduces error rates from 40-70% to below 15%, enabling models to exceed 95% accuracy on mathematical reasoning tasks through selective abstention.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。