NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
policy initialization
3 papers
Learning from Demonstrations via Capability-Aware Goal Sampling
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
When Can Model-Free Reinforcement Learning be Enough for Thinking?