arXiv:2607.09081cs.CV2026-07中稿 · ECCV

用扩散模型生成动作分割数据的紧凑表示,效率更高且更准确。

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

论文配图:Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation
图 1 · 摘自论文原文
  • 用扩散模型将动作片段建模为噪声空间中的连续轨迹,通过稀疏点锚定。
  • 在Breakfast数据集上仅用2.4%的数据量就达到真实数据训练效果。
  • 自适应分配锚点预算,难重构片段获得更多表示资源。

针对动作分割任务的数据集压缩旨在生成长而未剪辑视频数据的紧凑且信息丰富的表示。现有方法依赖变分自编码器与迭代潜在空间优化,计算成本高,且存在重建过平滑和时间约束僵化的问题。本文提出将压缩范式从基于优化的逆向映射转向确定性潜在映射。通过利用去噪扩散隐式模型,我们将动作片段表示为噪声流形中由稀疏潜在点锚定的连续轨迹。为最大化表征效率,引入自适应分配机制,根据片段级重建难度动态重分配锚点预算。大量实验表明,本框架在多个常用数据集上的分割性能显著优于现有最优方法。尤其在Breakfast数据集上,仅以2.4%的压缩比即实现与真实数据训练相当的性能。

原文摘要 · Abstract (English)

Dataset condensation for action segmentation synthesizes compact, informative representations of long, untrimmed video datasets. The existing approach relies on Variational Autoencoders and an iterative latent optimization; it is computationally expensive and suffers from over-smoothed reconstructions and rigid temporal constraints. This paper proposes to shift the condensation paradigm from optimization-based inversion to deterministic latent mapping. By leveraging Denoising Diffusion Implicit Models, we represent action segments as continuous trajectories anchored by sparse latent points in the noise manifold. To maximize representational efficiency, we introduce an adaptive allocation mechanism that dynamically redistributes the anchoring budget based on segment-wise reconstruction difficulty. Extensive experiments demonstrate that our framework significantly outperforms state-of-the-art methods in segmentation performance across common datasets. Notably, our approach achieves performance parity with real data training while maintaining a condensation ratio of 2.4\% on Breakfast dataset.

数据压缩动作分割扩散模型潜空间

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。