reasoning models
AI models designed to simulate logical deduction and problem-solving abilities, often used in applications requiring complex reasoning tasks such as mathematics, natural language understanding, and planning.
- AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
- Attention Sinks: A 'Catch, Tag, Release' Mechanism for Embeddings
- Best-of-N Jailbreaking
- Beyond Oracle: Verifier-Supervision for Instruction Hierarchy in Reasoning and Instruction-Tuned LLMs
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- Does Thinking More Always Help? Mirage of Test-Time Scaling in Reasoning Models
- EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
- Eliciting Reasoning in Language Models with Cognitive Tools
- Emergent Risk Awareness in Rational Agents under Resource Constraints
- Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
- GRIT: Teaching MLLMs to Think with Images
- Large Language Models as End-to-end Combinatorial Optimization Solvers
- Let Me Think! A Long Chain of Thought Can Be Worth Exponentially Many Short Ones
- Quantifying Elicitation of Latent Capabilities in Language Models
- R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
- Reasoning Gym: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
- Reasoning Models Better Express Their Confidence
- Reasoning Models Sometimes Output Illegible Chains of Thought
- Reviving DSP for Advanced Theorem Proving in the Era of Reasoning Models
- Scaling Speculative Decoding with Lookahead Reasoning
- ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning
- TimE: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
- Training Language Models to Reason Efficiently
- Training a Scientific Reasoning Model for Chemistry
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
- What’s in Common? Multimodal Models Hallucinate When Reasoning Across Scenes