arXiv:2606.22436cs.LG2026-06被引 1

提出新型鲁棒双层优化方法,有效应对重尾噪声干扰。

Distribution-Aware Robust Bilevel Optimization: Quantile-Guided Huber Updates in Two-Timescale Stochastic Approximation

论文配图:Distribution-Aware Robust Bilevel Optimization: Quantile-Guided Huber Updates in Two-Timescale Stochastic Approximation
图 1 · 摘自论文原文
  • 用历史梯度估计分位数,自适应调整Huber截断策略。
  • 在六类任务中稳定收敛,避免发散峰值,提升鲁棒性。
  • 计算开销仅增2.7%,适合实际部署的双层学习场景。

双层优化(BLO)是层级决策的核心,但在重尾随机噪声下存在严重不稳定性。现有方差减少方法依赖短视的幅值检测,无法区分有信息的几何信号与突发异常值。为此,本文提出RQ-TTSA(鲁棒分位数引导的两时标随机逼近),通过历史梯度缓冲估计滚动分位数,实现自适应的Huber式截断,有效保留局部优化几何结构的同时严格控制有效方差。理论上,在非凸-强凸假设下,针对无穷方差噪声($p \in (1,2]$),推导出$</math&gt;$</math&gt;的收敛率,恢复了对重尾参数的最优依赖关系。实验上,在六种不同任务中——包括异构视觉基准、受动量毒化影响的动态博弈,以及离线强化学习——RQ-TTSA始终优于最先进基线,消除发散尖峰并确保稳定收敛。方法对超参数变化具有显著鲁棒性,计算开销仅增加约2.7%,验证了分布感知梯度控制在可靠双层学习中的实用性和必要性。

原文摘要 · Abstract (English)

Bilevel optimization (BLO) is fundamental to hierarchical decision-making but suffers from critical instability under heavy-tailed stochastic noise. Existing variance-reduction techniques typically rely on myopic magnitude checks, which fail to distinguish informative geometric signals from impulsive outliers. To resolve this, we propose \textbf{RQ-TTSA} (Robust Quantile-guided TTSA), a distribution-aware framework that leverages historical gradient buffers to estimate rolling quantiles for adaptive Huber-style clipping, effectively preserving local optimization geometry while strictly bounding effective variance. Theoretically, we provide a convergence analysis for quantile-guided TTSA under nonconvex-strongly convex assumptions with infinite-variance noise ($p \in (1,2]$), deriving a rate of $\mathcal{O}(T^{-\frac{p-1}{3p-2}})$ that recovers optimal dependence on the heavy-tailed parameter. Empirically, across six diverse tasks, spanning heterogeneous vision benchmarks, dynamic games under momentum poisoning, and offline reinforcement learning, RQ-TTSA consistently outperforms state-of-the-art baselines by eliminating divergence spikes and ensuring stable convergence. Our method demonstrates significant robustness to hyperparameter variations and incurs negligible computational overhead ($\approx 2.7\%$ increase), validating distribution-aware gradient control as a practical and necessary component for reliable bilevel learning.

双层优化鲁棒学习重尾噪声梯度截断

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。