mathematical benchmarks
- Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
- How Far Are We from Optimal Reasoning Efficiency?
- Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
- Let LRMs Break Free from Overthinking via Self-Braking Tuning
- MathArena: Evaluating LLMs on Uncontaminated Math Competitions
- Mitigating Overthinking in Large Reasoning Models via Manifold Steering
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning