Xihui Liu
- GoT: Unleashing Reasoning Capability of MLLM for Visual Generation and Editing
- OST-Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance