chain-of-thought
An approach in reasoning where a model generates intermediate reasoning steps to arrive at a conclusion or decision, allowing for better interpretability and alignment with human-like thinking processes.
- A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers
- A*-Thought: Efficient Reasoning via Bidirectional Compression for Low-Resource Settings
- Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models
- AnomalyCoT: A Multi-Scenario Chain-of-Thought Dataset for Multimodal Large Language Models
- BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
- Bag of Tricks for Inference-time Computation of LLM Reasoning
- Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data
- Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
- Caption This, Reason That: VLMs Caught in the Middle
- Causal Sufficiency and Necessity Improves Chain-of-Thought Reasoning
- Chain of Execution Supervision Promotes General Reasoning in Large Language Models
- DIPO: Dual-State Images Controlled Articulated Object Generation Powered by Diverse Data
- Efficiently Scaling LLM Reasoning Programs with Certaindex
- Eliciting Reasoning in Language Models with Cognitive Tools
- General-Reasoner: Advancing LLM Reasoning Across All Domains
- Hybrid Latent Reasoning via Reinforcement Learning
- Incentivizing Reasoning for Advanced Instruction-Following of Large Language Models
- JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
- LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
- Language Models can Self-Improve at State-Value Estimation for Better Search
- MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
- Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- Prompting as Scientific Inquiry
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Reasoning Models Sometimes Output Illegible Chains of Thought
- SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought
- SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
- Scalable Best-of-N Selection for Large Language Models via Self-Certainty
- Scaling Speculative Decoding with Lookahead Reasoning
- Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
- SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
- ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning
- Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
- TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs
- Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
- VIKI‑R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning
- VeriThinker: Learning to Verify Makes Reasoning Model Efficient
- When Thinking Drifts: Evidential Grounding for Robust Video Reasoning