Reasoning Gym: Reasoning Environments for Reinforcement Learning with Verifiable Rewards

Zafir Stojanovski (Eberhard-Karls-Universität Tübingen) · Oliver Stanley (Scale AI) · Joe Sharratt (Lloyds Banking Group) · Richard Jones (Independent) · Abdulhakeem Adefioye (Saint Cloud State University) · Jean Kaddour (University College London) · Andreas Köpf (PROVISIO GmbH)
adjustable complexityalgebracognitive taskscontinuous evaluationdomain adaptationevaluation metricsexperimental resultsgraph theoryprocedural generationreasoning environmentsreasoning gymreasoning modelsreinforcement learningtask configurationstraining dataverifiable rewards

We introduce Reasoning Gym, a library of reasoning environments for reinforcement learning with verifiable rewards (RLVR). It provides over 100 tasks spanning multiple domains including algebra, arithmetic, computation, cognition, geometry, graph theory, logic, and various common games. Its key innovation is the ability to generate virtually infinite training data with adjustable complexity, unlike most previous reasoning datasets, which are typically fixed. This procedural generation approach allows for continuous evaluation across varying difficulty levels and task configurations. Our experimental results demonstrate the efficacy of Reasoning Gym in both evaluating and reinforcement learning of reasoning models.