提出新变换方法,提升VAE的表征解耦能力。
Multiple Invertible and Partial-Equivariant Function for Latent Vector Transformation to Enhance Disentanglement in VAEs
- 设计可逆且部分等变的变换层,保持潜在空间结构
- 在3个数据集上显著提升现有VAE的解耦性能
- 适合需要可解释表征的生成模型研究者
解耦学习是理解与复用变分自编码器(VAEs)中学习表征的核心。尽管等变性已被探索,但有效利用其提升解耦仍具挑战。本文提出一种新方法——多重可逆部分等变变换(MIPE-Transformation),包含两部分:(1) 可逆部分等变变换(IPE-Transformation),确保潜在变量到变换后潜在变量的可逆映射,同时在变换后的潜在空间中保留输入到潜在的局部等变性;(2) 指数族转换(EF-Conversion),通过可学习转换将标准高斯先验扩展为近似指数族分布。在3D Cars、3D Shapes和dSprites数据集上的实验表明,MIPE-Transformation显著提升了当前先进VAE的解耦性能。
原文摘要 · Abstract (English)
Disentanglement learning is central to understanding and reusing learned representations in variational autoencoders (VAEs). Although equivariance has been explored in this context, effectively exploiting it for disentanglement remains challenging. In this paper, we propose a novel method, called Multiple Invertible and Partial-Equivariant Transformation (MIPE-Transformation), which integrates two main parts: (1) Invertible and Partial-Equivariant Transformation (IPE-Transformation), guaranteeing an invertible latent-to-transformed-latent mapping while preserving partial input-to-latent equivariance in the transformed latent space; and (2) Exponential-Family Conversion (EF-Conversion) to extend the standard Gaussian prior to an approximate exponential family via a learnable conversion. In experiments on the 3D Cars, 3D Shapes, and dSprites datasets, MIPE-Transformation improves the disentanglement performance of state-of-the-art VAEs.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。