preference datasets
- Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
- HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
- Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
- What Matters in Data for DPO?