TensorX
返回文献探索

Paper · arXiv 2410.08207

DICE: Discrete Inversion Enabling Controllable Editing for Multinomial Diffusion and Masked Generative Models

Xiaoxiao He, Ligong Han, Quan Dao, Song Wen, Minhao Bai, Di Liu, Han Zhang, Martin Renqiang Min, Felix Juefei-Xu, Chaowei Tan, Bo Liu, Kang Li, Hongdong Li, Junzhou Huang, Faez Ahmed, Akash Srivastava, Dimitris Metaxas

19 upvotesOctober 10, 2024arXiv 预印本
AI 摘要

DICE enables precise inversion and flexible editing for discrete diffusion models, enhancing content manipulation in image and text domains.

discrete diffusion modelsDICEmultinomial diffusionmasked generative modelsreverse diffusion processVQ-DiffusionPaellaRoBERTahigh data fidelityfine-grained content manipulation

Abstract

Discrete diffusion models have achieved success in tasks like image generation and masked language modeling but face limitations in controlled content editing. We introduce DICE (Discrete Inversion for Controllable Editing), the first approach to enable precise inversion for discrete diffusion models, including multinomial diffusion and masked generative models. By recording noise sequences and masking patterns during the reverse diffusion process, DICE enables accurate reconstruction and flexible editing of discrete data without the need for predefined masks or attention manipulation. We demonstrate the effectiveness of DICE across both image and text domains, evaluating it on models such as VQ-Diffusion, Paella, and RoBERTa. Our results show that DICE preserves high data fidelity while enhancing editing capabilities, offering new opportunities for fine-grained content manipulation in discrete spaces. For project webpage, see https://hexiaoxiao-cs.github.io/DICE/.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
DICE: Discrete Inversion Enabling Controllable Editing for Multinomial Diffusion and Masked Generative Models | TensorX