grounding
- ESCA: Contextualizing Embodied Agents via Scene-Graph Generation
- Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning