arXiv:2411.16725cs.CV2024-11ICCV被引 31

揭示扩散模型中语义信息的分布规律,提升黑箱模型可解释性。

$\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion models

  • 用k稀疏自编码器提取扩散模型各层与去噪阶段的可解释特征。
  • 在4个数据集上验证扩散特征在表征学习中的有效性。
  • 适合关注模型可解释性与迁移学习的研究者参考。

我们研究了不同扩散架构在各层级和去噪步骤中蕴含的视觉语义信息的丰富程度。通过引入k稀疏自编码器(k-SAE),我们发现了单义性可解释特征。利用轻量级分类器对现成扩散模型的特征进行迁移学习,验证了机制解释的可靠性。在4个数据集上,证明了扩散特征在表征学习中的有效性。深入分析了不同扩散架构、预训练数据集以及语言模型条件对视觉表征粒度、归纳偏置和迁移能力的影响。本工作是深化黑箱扩散模型可解释性的关键一步。代码与可视化见:https://github.com/revelio-diffusion/revelio

原文摘要 · Abstract (English)

We study $\textit{how}$ rich visual semantic information is represented within various layers and denoising timesteps of different diffusion architectures. We uncover monosemantic interpretable features by leveraging k-sparse autoencoders (k-SAE). We substantiate our mechanistic interpretations via transfer learning using light-weight classifiers on off-the-shelf diffusion models' features. On $4$ datasets, we demonstrate the effectiveness of diffusion features for representation learning. We provide an in-depth analysis of how different diffusion architectures, pre-training datasets, and language model conditioning impacts visual representation granularity, inductive biases, and transfer learning capabilities. Our work is a critical step towards deepening interpretability of black-box diffusion models. Code and visualizations available at: https://github.com/revelio-diffusion/revelio

可解释性扩散模型表征学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。