long-horizon reasoning
- Fast Monte Carlo Tree Diffusion: 100× Speedup via Parallel and Sparse Planning
- Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
- Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
- ReCAP: Recursive Context-Aware Reasoning and Planning for Large Language Model Agents
- WebThinker: Empowering Large Reasoning Models with Deep Research Capability