visual tokens
Discrete representations or features extracted from visual data, used in models like Vision Transformers to facilitate processing and understanding of images.
- ARGenSeg: Image Segmentation with Autoregressive Image Generation Model
- Cameras as Relative Positional Encoding
- Each Complexity Deserves a Pruning Policy
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
- End-to-End Vision Tokenizer Tuning
- Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders
- Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
- FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving
- Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression
- HoliTom: Holistic Token Merging for Fast Video Large Language Models
- Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
- MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
- State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding
- The Promise of RL for Autoregressive Image Editing
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning