regularization strength
- Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
- Linearization Explains Fine-Tuning in Large Language Models
- Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling
- Optimal Rates in Continual Linear Regression via Increasing Regularization