Personalized Visual Instruction Tuning
Renjie Pi, Jianshu Zhang, Tianyang Han +3 authors
A new framework called Personalized Visual Instruction Tuning (PVIT) enhances multimodal large language models to recognize and engage with specific individuals in images, utilizing a curated dataset and benchmarks for evaluation.