Aviral Kumar
- Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners
- Compute-Optimal Scaling for Value-Based Deep RL
- Grounded Reinforcement Learning for Visual Reasoning
- Horizon Reduction Makes RL Scalable
- Reasoning as an Adaptive Defense for Safety
- Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction