Kai-Wei Chang
- 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
- Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence
- LaViDa: A Large Diffusion Model for Vision-Language Understanding
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding