cross-modal retrieval
Cross-modal retrieval refers to retrieving information from one modality (e.g., images) based on queries from another modality (e.g., text). This is important for applications like image search based on textual descriptions.
- CellCLIP - Learning Perturbation Effects in Cell Painting via Text-Guided Contrastive Learning
- Generalized Contrastive Learning for Universal Multimodal Retrieval
- MotionBind: Multi-Modal Human Motion Alignment for Retrieval, Recognition, and Generation
- SensorLM: Learning the Language of Wearable Sensors
- TRACE: Grounding Time Series in Context for Multimodal Embedding and Retrieval
- Unbiased Prototype Consistency Learning for Multi-Modal and Multi-Task Object Re-Identification
- With Limited Data for Multimodal Alignment, Let the STRUCTURE Guide You