Xintao Wang
- ARIA: Training Language Agents with Intention-driven Reward Aggregation
- Flow-GRPO: Training Flow Matching Models via Online RL
- Improving Video Generation with Human Feedback
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints