grpo
GRPO (Generalized Robust Poisson Optimization) refers to a class of optimization techniques that are robust against noise and uncertainty in data, commonly applied in resource allocation problems.
- Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
- Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
- Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
- Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
- Perception-R1: Pioneering Perception Policy with Reinforcement Learning
- Preference Learning with Lie Detectors can Induce Honesty or Evasion
- Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
- The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
- Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
- What Can RL Bring to VLA Generalization? An Empirical Study