Pengfei Wan
- Flow-GRPO: Training Flow Matching Models via Online RL
- Improving Video Generation with Human Feedback
- MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
- Training-Free Efficient Video Generation via Dynamic Token Carving
- VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
- VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models