image tokens
- Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
- Polyline Path Masked Attention for Vision Transformer
- The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models
- ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding