TensorX
返回文献探索

Paper · arXiv 2503.16418

InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity

Liming Jiang, Qing Yan, Yumin Jia, Zichuan Liu, Hao Kang, Xin Lu

36 upvotesMarch 20, 2025arXiv 预印本
AI 摘要

InfiniteYou leverages Diffusion Transformers to generate high-fidelity identity-preserved images, addressing issues of identity similarity, text-image alignment, and quality through a novel framework and training strategy.

Diffusion TransformersDiTsInfiniteYouInfUInfuseNetresidual connectionspretrainingsupervised fine-tuningSFTsynthetic single-person-multiple-sampleSPMSstate-of-the-art performance

Abstract

Achieving flexible and high-fidelity identity-preserved image generation remains formidable, particularly with advanced Diffusion Transformers (DiTs) like FLUX. We introduce InfiniteYou (InfU), one of the earliest robust frameworks leveraging DiTs for this task. InfU addresses significant issues of existing methods, such as insufficient identity similarity, poor text-image alignment, and low generation quality and aesthetics. Central to InfU is InfuseNet, a component that injects identity features into the DiT base model via residual connections, enhancing identity similarity while maintaining generation capabilities. A multi-stage training strategy, including pretraining and supervised fine-tuning (SFT) with synthetic single-person-multiple-sample (SPMS) data, further improves text-image alignment, ameliorates image quality, and alleviates face copy-pasting. Extensive experiments demonstrate that InfU achieves state-of-the-art performance, surpassing existing baselines. In addition, the plug-and-play design of InfU ensures compatibility with various existing methods, offering a valuable contribution to the broader community.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
InfiniteYou: Flexible Photo Recrafting While Preserving Your Identity | TensorX