sparse rewards
- BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
- Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners
- Flattening Hierarchies with Policy Bootstrapping
- Group-in-Group Policy Optimization for LLM Agent Training
- Uncertainty-Based Smooth Policy Regularisation for Reinforcement Learning with Few Demonstrations