NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
policy gradient methods
3 papers
Ask a Strong LLM Judge when Your Reward Model is Uncertain
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning