grpo algorithm
- GRIT: Teaching MLLMs to Think with Images
- Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- Video-R1: Reinforcing Video Reasoning in MLLMs