SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
Youngjoon Yu, Sangyun Chung, Byung-Kwan Lee +1 authors
A benchmark called SPARK is established to evaluate multi-vision sensory perception and reasoning in large-scale vision-language models, revealing deficiencies in understanding physical sensor characteristics.