image-text pairs
Image-text pairs are datasets that consist of corresponding images and their descriptive text, commonly used in multi-modal learning tasks such as captioning or cross-modal retrieval.
- Contrastive Learning with Data Misalignment: Feature Purity, Training Dynamics and Theoretical Generalization Guarantees
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- MMCSBench: A Fine-Grained Benchmark for Large Vision-Language Models in Camouflage Scenes
- MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives
- Meta CLIP 2: A Worldwide Scaling Recipe
- NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
- On the Value of Cross-Modal Misalignment in Multimodal Representation Learning
- PoGDiff: Product-of-Gaussians Diffusion Models for Imbalanced Text-to-Image Generation