policy gradients
- Fair Cooperation in Mixed-Motive Games via Conflict-Aware Gradient Adjustment
- Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
- Globally Optimal Policy Gradient Algorithms for Reinforcement Learning with PID Control Policies
- The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning