Meissonic让非自回归图像生成媲美扩散模型,高效生成高清图。
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
- 用架构创新和位置编码优化,提升非自回归图像建模效率。
- 在1024×1024分辨率下生成质量超越或媲美SDXL。
- 适合追求高效高分辨率图像生成的研究者与开发者。
我们提出Meissonic,将非自回归掩码图像建模(MIM)文本到图像生成能力提升至与当前顶尖扩散模型(如SDXL)相当水平。通过一系列架构创新、先进位置编码策略及优化采样条件,显著提升MIM的性能与效率。此外,采用高质量训练数据,引入基于人类偏好评分的微条件,结合特征压缩层,进一步增强图像保真度与分辨率。大量实验验证了Meissonic的能力,证明其在生成高质量、高分辨率图像方面具有潜力,可作为新的文本到图像合成标准。我们发布一个支持生成1024×1024分辨率图像的模型检查点。
原文摘要 · Abstract (English)
We present Meissonic, which elevates non-autoregressive masked image modeling (MIM) text-to-image to a level comparable with state-of-the-art diffusion models like SDXL. By incorporating a comprehensive suite of architectural innovations, advanced positional encoding strategies, and optimized sampling conditions, Meissonic substantially improves MIM's performance and efficiency. Additionally, we leverage high-quality training data, integrate micro-conditions informed by human preference scores, and employ feature compression layers to further enhance image fidelity and resolution. Our model not only matches but often exceeds the performance of existing models like SDXL in generating high-quality, high-resolution images. Extensive experiments validate Meissonic's capabilities, demonstrating its potential as a new standard in text-to-image synthesis. We release a model checkpoint capable of producing $1024 \times 1024$ resolution images.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。