policy optimization
A method in reinforcement learning focused on improving a decision-making policy based on feedback from the environment, emphasizing maximizing cumulative rewards through iterative updates.
- ARIA: Training Language Agents with Intention-driven Reward Aggregation
- Accelerating RL for LLM Reasoning with Optimal Advantage Regression
- Aligning Compound AI Systems via System-level DPO
- Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data
- Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning
- DAPO : Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage-Based Policy Optimization
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- DPAIL: Training Diffusion Policy for Adversarial Imitation Learning without Policy Optimization
- DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving
- EconGym: A Scalable AI Testbed with Diverse Economic Tasks
- HCRMP: An LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving
- Intrinsic Benefits of Categorical Distributional Loss: Uncertainty-aware Regularized Exploration in Reinforcement Learning
- Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis
- MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures
- Non-convex entropic mean-field optimization via Best Response flow
- On the Sample Complexity of Differentially Private Policy Optimization
- Progress Reward Model for Reinforcement Learning via Large Language Models
- Prompted Policy Search: Reinforcement Learning through Linguistic and Numerical Reasoning in LLMs
- ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
- Scalable Policy-Based RL Algorithms for POMDPs
- Scaling Offline RL via Efficient and Expressive Shortcut Models
- Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
- Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
- ShiQ: Bringing back Bellman to LLMs
- Towards Principled Unsupervised Multi-Agent Reinforcement Learning
- Trust Region Reward Optimization and Proximal Inverse Reward Optimization Algorithm
- UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
- Value Diffusion Reinforcement Learning