mathematical reasoning
The ability of AI systems to apply formal logic and mathematical principles to solve problems, make inferences, and reach conclusions. This aspect is crucial for tasks that require explicit reasoning or proof generation.
- Absolute Zero: Reinforced Self-play Reasoning with Zero Data
- Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving
- Analyzing the Power of Chain of Thought through Memorization Capabilities
- Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities
- AutoJudge: Judge Decoding Without Manual Annotation
- BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
- Benchmarking Large Language Models with Integer Sequence Generation Tasks
- Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
- GRIP: A Graph-Based Reasoning Instruction Producer
- General-Reasoner: Advancing LLM Reasoning Across All Domains
- GoRA: Gradient-driven Adaptive Low Rank Adaptation
- IneqSearch: Hybrid Reasoning for Olympiad Inequality Proofs
- Lookahead Routing for Large Language Models
- MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
- Mixture of Inputs: Text Generation Beyond Discrete Token Sampling
- On Extending Direct Preference Optimization to Accommodate Ties
- Once Upon an Input: Reasoning via Per-Instance Program Synthesis
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
- RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
- RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
- Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
- Reinforcement Learning for Reasoning in Large Language Models with One Training Example
- Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
- SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
- The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
- Who Reasons in the Large Language Models?