VisionZip: Longer is Better but Not Necessary in Vision Language Models
Senqiao Yang, Yukang Chen, Zhuotao Tian +4 authors
VisionZip reduces visual token redundancy and enhances efficiency in vision-language models, improving performance and inference speed across various tasks.