TensorX
返回文献探索

Paper · arXiv 2412.07774

UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics

Xi Chen, Zhifei Zhang, He Zhang, Yuqian Zhou, Soo Ye Kim, Qing Liu, Yijun Li, Jianming Zhang, Nanxuan Zhao, Yilin Wang, Hui Ding, Zhe Lin, Hengshuang Zhao

30 upvotesDecember 10, 2024arXiv 预印本
AI 摘要

UniReal treats image generation and editing tasks as discontinuous video generation to capture visual variations and consistency, learning from large-scale video data.

unifying approachdiscontinuous video generationimage-level tasksuniversal supervisionworld dynamics

Abstract

We introduce UniReal, a unified framework designed to address various image generation and editing tasks. Existing solutions often vary by tasks, yet share fundamental principles: preserving consistency between inputs and outputs while capturing visual variations. Inspired by recent video generation models that effectively balance consistency and variation across frames, we propose a unifying approach that treats image-level tasks as discontinuous video generation. Specifically, we treat varying numbers of input and output images as frames, enabling seamless support for tasks such as image generation, editing, customization, composition, etc. Although designed for image-level tasks, we leverage videos as a scalable source for universal supervision. UniReal learns world dynamics from large-scale videos, demonstrating advanced capability in handling shadows, reflections, pose variation, and object interaction, while also exhibiting emergent capability for novel applications.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics | TensorX