clip
CLIP (Contrastive Language-Image Pretraining) is a model developed by OpenAI that learns to understand images and text together, allowing for tasks like zero-shot image classification by aligning textual and visual semantics.
- Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment
- Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection
- Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
- Global Minimizers of Sigmoid Contrastive Loss
- LT-Soups: Bridging Head and Tail Classes via Subsampled Model Soups
- Multimodal Causal Reasoning for UAV Object Detection
- Object-centric binding in Contrastive Language-Image Pretraining
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision
- The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
- UniTok: a Unified Tokenizer for Visual Generation and Understanding
- Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
- un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP