ppo
Proximal Policy Optimization (PPO) is a reinforcement learning algorithm that strikes a balance between exploration and stability. It restricts how much the policy can change in a single update, aiming to improve learning efficiency and performance.
- Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
- GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
- Risk-Averse Constrained Reinforcement Learning with Optimized Certainty Equivalents
- Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
- What Can RL Bring to VLA Generalization? An Empirical Study