SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
Xiaoxuan Wang, Ziniu Hu, Pan Lu +7 authors
SciBench introduces an extensive benchmark suite to evaluate the reasoning capabilities of large language models on complex scientific problems, revealing areas for improvement in these models' performance.