vision language model
- 3D Visual Illusion Depth Estimation
- Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
- MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics