embodied reasoning
- Intend to Move: A Multimodal Dataset for Intention-Aware Human Motion Understanding
- PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning