AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining
Haohe Liu, Qiao Tian, Yi Yuan +7 authors
A unified audio generation framework using a language of audio representation, AudioMAE, and latent diffusion model achieves state-of-the-art performance across different audio types.