TensorX
返回文献探索

Paper · arXiv 2502.00698

MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models

Huanqia Cai, Yijun Yang, Winston Hu

24 upvotesFebruary 2, 2025arXiv 预印本
AI 摘要

A multimodal IQ test framework (MM-IQ) is presented to evaluate reasoning capacities in AI, revealing significant performance gaps compared to human baselines.

multimodal systemsreasoning paradigmssystematic evaluationbenchmarking

Abstract

IQ testing has served as a foundational methodology for evaluating human cognitive capabilities, deliberately decoupling assessment from linguistic background, language proficiency, or domain-specific knowledge to isolate core competencies in abstraction and reasoning. Yet, artificial intelligence research currently lacks systematic benchmarks to quantify these critical cognitive dimensions in multimodal systems. To address this critical gap, we propose MM-IQ, a comprehensive evaluation framework comprising 2,710 meticulously curated test items spanning 8 distinct reasoning paradigms. Through systematic evaluation of leading open-source and proprietary multimodal models, our benchmark reveals striking limitations: even state-of-the-art architectures achieve only marginally superior performance to random chance (27.49% vs. 25% baseline accuracy). This substantial performance chasm highlights the inadequacy of current multimodal systems in approximating fundamental human reasoning capacities, underscoring the need for paradigm-shifting advancements to bridge this cognitive divide.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models | TensorX