NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
sparse reward
3 papers
DAPO : Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage-Based Policy Optimization
R1-ShareVL: Incentivizing Reasoning Capabilities of Multimodal Large Language Models via Share-GRPO
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning