cross-modal alignment
The process of ensuring that different modalities (e.g., text and images) are semantically consistent and contextually aligned. This is crucial for developing effective multimodal models.
- 3EED: Ground Everything Everywhere in 3D
- Aligning What Matters: Masked Latent Adaptation for Text-to-Audio-Video Generation
- Beyond Modality Collapse: Representation Blending for Multimodal Dataset Distillation
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- Enhancing CLIP Robustness via Cross-Modality Alignment
- GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images
- HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
- HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
- ReID5o: Achieving Omni Multi-modal Person Re-identification in a Single Model
- Scaling Language-centric Omnimodal Representation Learning
- Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning
- scMRDR: A scalable and flexible framework for unpaired single-cell multi-omics data integration