Xiaojuan Qi
- DLoFT: Gradient-Decoupled Fine-Tuning for Generalizable Long Chain-of-Thought Reasoning
- EAG3R: Event-Augmented 3D Geometry Estimation for Dynamic and Extreme-Lighting Scenes
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- Scaling RL to Long Videos
- Understanding Data Influence in Reinforcement Finetuning
- UniTok: a Unified Tokenizer for Visual Generation and Understanding
- Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Generation