cross-modal interactions
The ways in which different types of data, such as text and images, influence each other within a model, enabling richer representations and better understanding of complex relationships.
- Amplifying Prominent Representations in Multimodal Learning via Variational Dirichlet Process
- Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
- JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
- MAESTRO : Adaptive Sparse Attention and Robust Learning for Multimodal Dynamic Time Series
- UniteFormer: Unifying Node and Edge Modalities in Transformers for Vehicle Routing Problems