dpo
- Adaptive Distraction: Probing LLM Contextual Robustness with Automated Tree Search
- Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?
- From Judgment to Interference: Early Stopping LLM Harmful Outputs via Streaming Content Monitoring
- Preference Learning with Lie Detectors can Induce Honesty or Evasion
- SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization
- Tracing the Representation Geometry of Language Models from Pretraining to Post-training
- What Can RL Bring to VLA Generalization? An Empirical Study