arXiv:2603.25728cs.CVcs.AI2026-03

用扩散模型实现细腻可控的面部表情编辑,突破语义重叠瓶颈

PixelSmile: Toward Fine-Grained Facial Expression Editing

  • 通过对称联合训练解耦表情语义,结合强度监督与对比学习
  • 实现精确线性控制,表情编辑准确率提升且身份保持更稳定
  • 适合需要细腻表情调整的视频生成与数字人应用

细粒度面部表情编辑长期受限于内在语义重叠。为此,我们构建了包含连续情感标注的柔韧面部表情(FFE)数据集,并建立 FFE-Bench 用于评估结构混淆、编辑准确性、线性可控制性及表情编辑与身份保留之间的权衡。提出 PixelSmile,一种通过完全对称联合训练解耦表达语义的扩散框架。PixelSmile 结合强度监督与对比学习,生成更强烈且更易区分的表情,通过文本潜在空间插值实现精确稳定的线性表达控制。大量实验表明,PixelSmile 在解耦性和身份保持鲁棒性方面表现卓越,证实其在连续、可控、细粒度表情编辑中的有效性,同时自然支持平滑表情融合。

原文摘要 · Abstract (English)

Fine-grained facial expression editing has long been limited by intrinsic semantic overlap. To address this, we construct the Flex Facial Expression (FFE) dataset with continuous affective annotations and establish FFE-Bench to evaluate structural confusion, editing accuracy, linear controllability, and the trade-off between expression editing and identity preservation. We propose PixelSmile, a diffusion framework that disentangles expression semantics via fully symmetric joint training. PixelSmile combines intensity supervision with contrastive learning to produce stronger and more distinguishable expressions, achieving precise and stable linear expression control through textual latent interpolation. Extensive experiments demonstrate that PixelSmile achieves superior disentanglement and robust identity preservation, confirming its effectiveness for continuous, controllable, and fine-grained expression editing, while naturally supporting smooth expression blending.

面部编辑扩散模型表情控制

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。