KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation

Robert Tang (Yale University) · Wei Zhang (Guangzhou University) · Ge Zhang (University of Michigan - Ann Arbor) · Bingli Wang (Sichuan Agricultural University) · Siyu Yuan (Fudan University) · Jiangjie Chen (ByteDance Seed) · Yifan Yao (Beijing University of Posts and Telecommunications) · Kaijing Ma (Tongji University) · Zhoufutu Wen (ByteDance Inc.) · Junting Zhou (Peking University) · Xingyuan Bu (Alibaba Group) · Ruibin Yuan (Carnegie Mellon University) · Zhoujun Li (Beijing University of Aeronautics and Astronautics) · Jian Yang (nanjing university) · ZHAO-XIANG ZHANG (Chinese Academy of Sciences, China) · Wangchunshu Zhou (Guangdong OPPO Mobile Telecommunications Corp.,Ltd.) · Jiaheng Liu (Nanjing University) · Wenhao Huang (Key Laboratory of Machine Perception) · Jiajun Shi (Beijing University of Aeronautics and Astronautics) · Yancheng He (Alibaba Group) · Liang Song (M-A-P) · Hualei Zhu (Beijing University of Aeronautics and Astronautics) · Shilong Li (Beijing University of Posts and Telecommunications) · Xingjian Wang (Shanghai University of Electric Power) · Wenjun Yang (University College London, University of London) · Yunli Wang (Kuaishou Technology) · Siyuan Fang (Beijing University of Posts and Telecommunications) · Qianyu He (Fudan University) · Yingshui Tan (Alibaba Group)
closed-source modelsdomain-specific benchmarksdynamic evaluation platformevaluation methodologiesevaluation methodsinteractive assessmentsknowledge orthogonal reasoning gymnasiummodality effectsmulti-turn assessmentsreasoning capabilitiesreasoning patternsreasoning strategiesreinforcement learning scenariosresponse length

Recent advancements in large language models (LLMs) underscore the need for more comprehensive evaluation methods to accurately assess their reasoning capabilities. Existing benchmarks are often domain-specific and thus cannot fully capture an LLM’s general reasoning potential. To address this limitation, we introduce the **Knowledge Orthogonal Reasoning Gymnasium (KORGym)**, a dynamic evaluation platform inspired by KOR-Bench and Gymnasium. KORGym offers over fifty games in either textual or visual formats and supports interactive, multi-turn assessments with reinforcement learning scenarios. Using KORGym, we conduct extensive experiments on 19 LLMs and 8 VLMs, revealing consistent reasoning patterns within model families and demonstrating the superior performance of closed-source models. Further analysis examines the effects of modality, reasoning strategies, reinforcement learning techniques, and response length on model performance. We expect KORGym to become a valuable resource for advancing LLM reasoning research and developing evaluation methodologies suited to complex, interactive environments.