TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
Zhengqing Yuan, Zhaoxu Li, Lichao Sun
TinyGPT-V, built on Phi-2 with vision modules from BLIP-2 or CLIP, offers high performance with low computational requirements, enabling efficient multimodal large language modeling.