kl regularization
- Improving Video Generation with Human Feedback
- Last Iterate Convergence in Monotone Mean Field Games
- Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
- Preference Learning with Lie Detectors can Induce Honesty or Evasion
- Reinforcement Learning Finetunes Small Subnetworks in Large Language Models