TensorX
返回文献探索

Paper · arXiv 2305.18729

Real-World Image Variation by Aligning Diffusion Inversion Chain

Yuechen Zhang, Jinbo Xing, Eric Lo, Jiaya Jia

5 upvotesMay 30, 2023arXiv 预印本
AI 摘要

RIVAL uses diffusion models and step-wise latent alignment to generate high-quality real-world image variations from a single exemplar, surpassing existing methods.

diffusion modelslatent distribution gapimage generation processsource image's inversion chainstep-wise latent distribution alignmentcross-image self-attentionfeature interactionstep-wise distribution normalizationsemantic-condition similarityperceptual qualityimage-conditioned text-to-image generationexample-based image inpainting

Abstract

Recent diffusion model advancements have enabled high-fidelity images to be generated using text prompts. However, a domain gap exists between generated images and real-world images, which poses a challenge in generating high-quality variations of real-world images. Our investigation uncovers that this domain gap originates from a latents' distribution gap in different diffusion processes. To address this issue, we propose a novel inference pipeline called Real-world Image Variation by ALignment (RIVAL) that utilizes diffusion models to generate image variations from a single image exemplar. Our pipeline enhances the generation quality of image variations by aligning the image generation process to the source image's inversion chain. Specifically, we demonstrate that step-wise latent distribution alignment is essential for generating high-quality variations. To attain this, we design a cross-image self-attention injection for feature interaction and a step-wise distribution normalization to align the latent features. Incorporating these alignment processes into a diffusion model allows RIVAL to generate high-quality image variations without further parameter optimization. Our experimental results demonstrate that our proposed approach outperforms existing methods with respect to semantic-condition similarity and perceptual quality. Furthermore, this generalized inference pipeline can be easily applied to other diffusion-based generation tasks, such as image-conditioned text-to-image generation and example-based image inpainting.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
Real-World Image Variation by Aligning Diffusion Inversion Chain | TensorX