preference pairs
- DP²O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution
- Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions
- Self-Supervised Direct Preference Optimization for Text-to-Image Diffusion Models
- Sparta Alignment: Collectively Aligning Multiple Language Models through Combat
- Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
- VPO: Reasoning Preferences Optimization Based on $\mathcal{V}$-Usable Information