arXiv:2504.02168cs.CVcs.AI2025-04CVPR被引 7

多维剪枝突破性能与延迟瓶颈,适配卷积与变压器模型。

MDP: Multidimensional Vision Model Pruning with Latency Constraint

  • 联合优化通道、注意力头、块等多维度剪枝,提升压缩效率。
  • 在ImageNet上实现28%加速,且精度反超前人方法1.4%。
  • 适用于高比例剪枝,尤其适合部署时对延迟敏感的场景。

现有结构化剪枝方法存在两大局限:一是仅支持细粒度如通道级别的剪枝,难以实现激进参数缩减;二是多数延迟感知方法依赖简化的线性模型,难以泛化到多维度交互的Transformer架构。本文提出多维剪枝(MDP),首次联合优化包括通道、查询、键、注意力头、嵌入和块在内的多种剪枝粒度。通过先进延迟建模精准捕捉各维度延迟变化,在满足延迟约束前提下实现精度与速度的最优平衡。将剪枝重构为混合整数非线性规划(MINLP),高效搜索全局最优结构。该框架兼容CNN与Transformer。大量实验表明,MDP显著优于先前方法,尤其在高剪枝率下表现突出:在ImageNet上,对ResNet50剪枝实现28%加速,且Top-1精度比HALP提升1.4%;相较最新Transformer剪枝方法Isomorphic,额外获得37%加速,精度提升0.7%。

原文摘要 · Abstract (English)

Current structural pruning methods face two significant limitations: (i) they often limit pruning to finer-grained levels like channels, making aggressive parameter reduction challenging, and (ii) they focus heavily on parameter and FLOP reduction, with existing latency-aware methods frequently relying on simplistic, suboptimal linear models that fail to generalize well to transformers, where multiple interacting dimensions impact latency. In this paper, we address both limitations by introducing Multi-Dimensional Pruning (MDP), a novel paradigm that jointly optimizes across a variety of pruning granularities-including channels, query, key, heads, embeddings, and blocks. MDP employs an advanced latency modeling technique to accurately capture latency variations across all prunable dimensions, achieving an optimal balance between latency and accuracy. By reformulating pruning as a Mixed-Integer Nonlinear Program (MINLP), MDP efficiently identifies the optimal pruned structure across all prunable dimensions while respecting latency constraints. This versatile framework supports both CNNs and transformers. Extensive experiments demonstrate that MDP significantly outperforms previous methods, especially at high pruning ratios. On ImageNet, MDP achieves a 28% speed increase with a +1.4 Top-1 accuracy improvement over prior work like HALP for ResNet50 pruning. Against the latest transformer pruning method, Isomorphic, MDP delivers an additional 37% acceleration with a +0.7 Top-1 accuracy improvement.

模型剪枝延迟优化Transformer

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。