chain-of-thought reasoning
A method in which a model generates explanations or reasoning steps leading to a conclusion, enhancing interpretability and logical clarity in outputs.
- AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
- AgentAuditor: Human-level Safety and Security Evaluation for LLM Agents
- Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
- Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
- Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations
- Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
- CIDD: Collaborative Intelligence for Structure-Based Drug Design Empowered by LLMs
- CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
- CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
- How Far Are We from Optimal Reasoning Efficiency?
- Knot So Simple: A Minimalistic Environment for Spatial Reasoning
- Large language models can learn and generalize steganographic chain-of-thought under process supervision
- Latent Chain-of-Thought for Visual Reasoning
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
- Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
- Multipole Attention for Efficient Long Context Reasoning
- NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
- On Learning Verifiers and Implications to Chain-of-Thought Reasoning
- One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
- OpenCUA: Open Foundations for Computer-Use Agents
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
- Reasoning Models Better Express Their Confidence
- Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
- Reward Reasoning Models
- System-1.5 Reasoning: Traversal in Language and Latent Spaces with Dynamic Shortcuts
- The Promise of RL for Autoregressive Image Editing
- Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
- ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
- Thinkless: LLM Learns When to Think
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- UniTransfer: Video Concept Transfer via Progressive Spatio-Temporal Decomposition
- Unlocking Multimodal Mathematical Reasoning via Process Reward Model
- Walking the Tightrope: Autonomous Disentangling Beneficial and Detrimental Drifts in Non-Stationary Custom-Tuning