Ming Tang
- FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
- PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
- SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought
- Tackling Biased Evaluators in Dueling Bandits