NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
cross-modal misalignment
3 papers
AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
On the Value of Cross-Modal Misalignment in Multimodal Representation Learning
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs