Kai Han
- Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation
- GSPN-2: Efficient Parallel Sequence Modeling
- MLLMs Need 3D-Aware Representation Supervision for Scene Understanding
- Panoptic Captioning: An Equivalence Bridge for Image and Text
- SEAL: Semantic-Aware Hierarchical Learning for Generalized Category Discovery
- VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
- Wukong's 72 Transformations: High-fidelity Textured 3D Morphing via Flow Models