MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains
Guoli Yin, Haoping Bai, Shuang Ma +21 authors
MMAU benchmark evaluates large language models' capabilities across multiple domains and essential skills using comprehensive offline tasks to enhance interpretability and reliability.