direct preference optimization
A methodology in AI that aims to optimize decision-making by directly learning a preference model from user feedback or comparative judgments. It utilizes these preferences to make more accurate predictions and recommendations tailored to individual users.
- A Gradient Guidance Perspective on Stepwise Preference Optimization for Diffusion Models
- Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
- Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization
- Aligning Compound AI Systems via System-level DPO
- Aligning Transformers with Continuous Feedback via Energy Rank Alignment
- CPO: Condition Preference Optimization for Controllable Image Generation
- Can DPO Learn Diverse Human Values? A Theoretical Scaling Law
- Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
- Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns
- Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback
- Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment
- Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
- Improving Video Generation with Human Feedback
- InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
- KL Penalty Control via Perturbation for Direct Preference Optimization
- LeVo: High-Quality Song Generation with Multi-Preference Alignment
- Less is More: Improving LLM Alignment via Preference Data Selection
- LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
- Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization
- Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling
- Multi-step Visual Reasoning with Visual Tokens Scaling and Verification
- Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
- On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization
- Preference Distillation via Value based Reinforcement Learning
- Preference Optimization by Estimating the Ratio of the Data Distribution
- Protein Inverse Folding From Structure Feedback
- Proximalized Preference Optimization for Diverse Feedback Types: A Decomposed Perspective on DPO
- Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
- SafeVid: Toward Safety Aligned Video Large Multimodal Models
- Self-Supervised Direct Preference Optimization for Text-to-Image Diffusion Models
- Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization
- Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
- Token-Level Self-Play with Importance-Aware Guidance for Large Language Models
- VPO: Reasoning Preferences Optimization Based on $\mathcal{V}$-Usable Information
- WebThinker: Empowering Large Reasoning Models with Deep Research Capability
- What Matters in Data for DPO?
- Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs