pretrained vision-language models
- DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models
- Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition