unstable optimization
- CodeMerge: Codebook-Guided Model Merging for Robust Test-Time Adaptation in Autonomous Driving
- Enhancing Diffusion-based Unrestricted Adversarial Attacks via Adversary Preferences Alignment
- ReDit: Reward Dithering for Improved LLM Policy Optimization
- Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs