Xiang Bai
- MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
- NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
- OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
- PlayerOne: Egocentric World Simulator
- PlayerOne: Egocentric World Simulator
- URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model