Hongsheng Li
- BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
- GoT: Unleashing Reasoning Capability of MLLM for Visual Generation and Editing
- MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
- NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
- NopeRoomGS: Indoor 3D Gaussian Splatting Optimization without Camera Pose Input
- Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
- Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning
- UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents
- VividFace: A Robost and High-Fidelity Video Face Swapping Framework
- WebGen-Bench: Evaluating LLMs on Generating Interactive and Functional Websites from Scratch
- WebGen-Bench: Evaluating LLMs on Generating Interactive and Functional Websites from Scratch