vlms
- ActiveVOO: Value of Observation Guided Active Knowledge Acquisition for Open-World Embodied Lifted Regression Planning
- Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning