通过复用历史请求的稀疏注意力模式,实现图像到视频生成的高效推理。
Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

- 利用相似请求间的稀疏注意力模式一致性,复用历史稀疏掩码避免重复计算。
- 默认配置下生成质量保持不变,推理速度提升2.16倍。
- 适合大规模部署图像到视频生成服务,尤其适用于模板化内容场景。
图像到视频生成的扩散模型服务计算开销大,难以大规模部署。真实场景中常出现相似请求,如重复的特效模板、相关主题和常见镜头布局。现有跨请求加速方法主要依赖特征复用。我们发现相似请求具有高度一致的稀疏注意力模式,可将历史稀疏掩码作为请求相关的先验,几乎无额外在线掩码预测开销。提出以 extbf{稀疏性复用}为核心的跨请求复用框架,辅以可选的 extbf{特征复用},并通过轻量级 extbf{引导增强}保障鲁棒性。稀疏性复用通过共享高质量的历史稀疏掩码,避免每个请求的在线掩码预测。可选特征复用对高度冗余的时空区域进行降采样计算,缓解边界伪影同时保持效率。引导增强在复用后强化图像/文本条件,减轻语义漂移与条件偏离问题。实验表明,默认稀疏性复用配置在保持生成质量的前提下,实现 extbf{2.16×}的速度提升。
原文摘要 · Abstract (English)
Serving diffusion models for image-to-video generation is computationally expensive, posing significant challenges for large-scale deployment. Real I2V workloads often contain similar requests, such as repeated effect templates, related subjects, and recurring shot layouts. Existing cross-request acceleration methods mainly exploit this redundancy through feature reuse. We observe that similar I2V requests also share highly consistent sparse attention patterns, enabling historical sparse masks to serve as request-conditioned priors with almost no online mask-prediction overhead. We propose a cross-request reuse framework centered on \textbf{sparsity reuse}, with \textbf{feature reuse} as an optional extension safeguarded by a lightweight \textbf{guidance enhancement}. Our sparsity reuse is implemented as shared sparse mask reuse, which reuses high-quality sparse masks from similar historical requests to avoid per-request online mask prediction. Optional feature reuse applies downsampled computation to highly redundant spatiotemporal regions, mitigating boundary artifacts while preserving efficiency gains. Guidance enhancement reinforces image/text conditioning after reuse, mitigating semantic drift and condition-adherence issues. Experiments show that default sparsity reuse configuration preserves generation quality with a \textbf{2.16$\times$} speedup.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。