TensorX
返回文献探索

Paper · arXiv 2409.03718

Geometry Image Diffusion: Fast and Data-Efficient Text-to-3D with Image-Based Surface Representation

Slava Elizarov, Ciara Rowles, Simon Donné

27 upvotesSeptember 5, 2024arXiv 预印本
AI 摘要

Geometry Image Diffusion leverages 2D representation and collaborative control from Text-to-Image models to generate high-quality 3D objects efficiently.

Geometry Image DiffusionGIMDiffusionCollaborative Controlgeometry images3D-aware architecturesText-to-Image modelsStable DiffusionIPAdapter3D assetssemantically meaningfulinternal structures

Abstract

Generating high-quality 3D objects from textual descriptions remains a challenging problem due to computational cost, the scarcity of 3D data, and complex 3D representations. We introduce Geometry Image Diffusion (GIMDiffusion), a novel Text-to-3D model that utilizes geometry images to efficiently represent 3D shapes using 2D images, thereby avoiding the need for complex 3D-aware architectures. By integrating a Collaborative Control mechanism, we exploit the rich 2D priors of existing Text-to-Image models such as Stable Diffusion. This enables strong generalization even with limited 3D training data (allowing us to use only high-quality training data) as well as retaining compatibility with guidance techniques such as IPAdapter. In short, GIMDiffusion enables the generation of 3D assets at speeds comparable to current Text-to-Image models. The generated objects consist of semantically meaningful, separate parts and include internal structures, enhancing both usability and versatility.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号