SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
Minglei Shi, Haolin Wang, Borui Zhang +11 authors
SVG-T2I framework enables high-quality text-to-image synthesis by training diffusion models within visual foundation model representation space, achieving competitive performance on benchmark datasets.