Mike Zheng Shou
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
- PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
- Show-o2: Improved Native Unified Multimodal Models
- Sparse Image Synthesis via Joint Latent and RoI Flow
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- macOSWorld: A Multilingual Interactive Benchmark for GUI Agents