Hang Xu
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
- INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
- PandaPose: 3D Human Pose Lifting from a Single Image via Propagating 2D Pose Prior to 3D Anchor Space
- SeePhys: Does Seeing Help Thinking? – Benchmarking Vision-Based Physics Reasoning
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization