Li Zhang
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- FedFACT: A Provable Framework for Controllable Group-Fairness Calibration in Federated Learning
- From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
- Future-Aware End-to-End Driving: Bidirectional Modeling of Trajectory Planning and Scene Evolution
- On the Stability of Graph Convolutional Neural Networks: A Probabilistic Perspective
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- UniMotion: A Unified Motion Framework for Simulation, Prediction and Planning