large vision language models
- Escaping the SpuriVerse: Can Large Vision-Language Models Generalize Beyond Seen Spurious Correlations?
- FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- Robustness in Both Domains: CLIP Needs a Robust Text Encoder