NExT-GPT: Any-to-Any Multimodal LLM
Shengqiong Wu, Hao Fei, Leigang Qu +2 authors
NExT-GPT, an any-to-any Multimodal Large Language Model, combines LLMs with multimodal adaptors and diffusion decoders to generate content across various modalities, enhanced by modality-switching instruction tuning and a curated dataset.