rule-based reinforcement learning
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- Perception-R1: Pioneering Perception Policy with Reinforcement Learning
- RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards
- Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
- Video-R1: Reinforcing Video Reasoning in MLLMs