test-time scaling
An approach where model behavior is adjusted based on the scale of tasks during inference, optimizing performance in varying scenarios.
- A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning
- AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
- Atom of Thoughts for Markov LLM Test-Time Scaling
- CURE: Co-Evolving Coders and Unit Testers via Reinforcement Learning
- Controlling Thinking Speed in Reasoning Models
- Does Thinking More Always Help? Mirage of Test-Time Scaling in Reasoning Models
- DreamPRM: Domain-reweighted Process Reward Model for Multimodal Reasoning
- Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
- ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
- Incentivizing LLMs to Self-Verify Their Answers
- Let Me Think! A Long Chain of Thought Can Be Worth Exponentially Many Short Ones
- Let the LLM Stick to Its Strengths: Learning to Route Economical LLM
- MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
- Meta-Learning an In-Context Transformer Model of Human Higher Visual Cortex
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- ProtInvTree: Deliberate Protein Inverse Folding with Reward-guided Tree Search
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- Representation Consistency for Accurate and Coherent LLM Answer Aggregation
- Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
- S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
- Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
- Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging
- SolverLLM: Leveraging Test-Time Scaling for Optimization Problem via LLM-Guided Search
- TTRL: Test-Time Reinforcement Learning
- TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
- Test-Time Scaling of Diffusion Models via Noise Trajectory Search
- Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction
- TimE: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
- UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
- Unlocking Multimodal Mathematical Reasoning via Process Reward Model