arXiv:2606.14787cs.CVcs.CR2026-06

通过对抗扰动分析六款图像生成模型,发现其行为可分两类。

Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs

  • 用自适应亚阈值扰动测试模型输出,量化差异。
  • 六模型分属两种行为模式:编辑型聚于紧密簇,生成型呈漂移态。
  • 适合研究生成模型训练机制或安全评估的从业者参考。

我们针对六款商用图像到图像生成系统(gpt-image-1、Gemini 2.5 Flash Image、Flux Kontext、SDXL img2img、SD3 img2img 和 Qwen Image Edit),在内容自适应的亚阈值感知(sub-JND)对抗扰动框架下进行评估,使用冻结的 DINOv2 ViT-B/14 模型对输出与原始参考图之间的令牌距离进行评分。在涵盖 COCO 照片、CelebA-HQ 人像及 AI 生成输入的 3,588 次调用数据集中,所有系统在二维(patch_mean, ssim_clean)空间中呈现出两个图像不变的行为带:经编辑训练的模型(Flux Kontext、Qwen Image Edit、Gemini)聚集于紧密带,而基于文本到图像(T2I)基模型、采样时适配的模型(SDXL、SD3、gpt-image-1)则分布在漂移带。

原文摘要 · Abstract (English)

We study six production image-to-image AI systems (gpt-image-1, Gemini 2.5 Flash Image, Flux Kontext, SDXL img2img, SD3 img2img, and Qwen Image Edit) under a content-adaptive sub-JND adversarial perturbation pipeline, scoring all outputs by frozen DINOv2 ViT-B/14 token distances against clean references. Across a 3,588-call corpus spanning COCO photographs, CelebA-HQ portraits, and AI-generated inputs, the six systems partition into two image-invariant behavioral bands on a 2D (patch_mean, ssim_clean) plane: edit-trained models (Flux Kontext, Qwen Edit, Gemini) cluster in a tight band, while T2I-base models adapted at sampling time (SDXL, SD3, gpt-image-1) cluster in a drift band.

图像生成模型指纹对抗测试

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。