group relative policy optimization
A method in reinforcement learning that focuses on optimizing policies with respect to group-level performance metrics rather than individual metrics. This is particularly useful in scenarios involving multiple agents or collaborative tasks.
- ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation
- ARM: Adaptive Reasoning Model
- Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
- Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- BLEUBERI: BLEU is a surprisingly effective reward for instruction following
- BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
- Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
- Fine-grained List-wise Alignment for Generative Medication Recommendation
- GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
- GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
- How to Train Your LLM Web Agent: A Statistical Diagnosis
- JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
- MURKA: Multi-Reward Reinforcement Learning with Knowledge Alignment for Optimization Tasks
- NaDRO: Leveraging Dual-Reward Strategies for LLMs Training on Noisy Data
- Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
- On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization
- Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Reinforced Active Learning for Large-Scale Virtual Screening with Learnable Policy Model
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
- Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models
- TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
- Think before Recommendation: Autonomous Reasoning-enhanced Recommender
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
- VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank