Di ZHANG
- Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
- Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
- Flow-GRPO: Training Flow Matching Models via Online RL
- Improving Video Generation with Human Feedback
- OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
- VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models