Shanghang Zhang
- AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
- Orochi: Versatile Biomedical Image Processor
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
- SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents
- URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model