training framework
- Distributional LLM-as-a-Judge
- Generating Informative Samples for Risk-Averse Fine-Tuning of Downstream Tasks
- Learning Preferences without Interaction for Cooperative AI: A Hybrid Offline-Online Approach
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation