NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Amy Zhang
4 papers
University of Texas at Austin
ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
Information-Theoretic Reward Decomposition for Generalizable RLHF
RLZero: Direct Policy Inference from Language Without In-Domain Supervision
Uni-RL: Unifying Online and Offline RL via Implicit Value Regularization