Jiebo Luo
- Latent Chain-of-Thought for Visual Reasoning
- MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
- On Inductive Biases That Enable Generalization in Diffusion Transformers
- OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
- PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
- Unleashing Hour-Scale Video Training for Long Video-Language Understanding
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension