vision transformers
A type of transformer model specifically designed for computer vision tasks. They adapt the attention mechanism of transformers to process images by dividing them into patches, leading to improvements in accuracy and computational efficiency over traditional convolutional neural networks.
- Alias-Free ViT: Fractional Shift Invariance via Linear Attention
- Auto-Compressing Networks
- Auto-Compressing Networks
- Beyond Scalars: Concept-Based Alignment Analysis in Vision Transformers
- DAMamba: Vision State Space Model with Dynamic Adaptive Scan
- Differentiable Hierarchical Visual Tokenization
- Distributional Training Data Attribution: What do Influence Functions Sample?
- Does Object Binding Naturally Emerge in Large Pretrained Vision Transformers?
- DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs
- Energy Landscape-Aware Vision Transformers: Layerwise Dynamics and Adaptive Task-Specific Training via Hopfield States
- Frequency-Aware Token Reduction for Efficient Vision Transformer
- GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers
- GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
- Generalized Linear Mode Connectivity for Transformers
- Generalized Linear Mode Connectivity for Transformers
- Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
- Interpreting vision transformers via residual replacement model
- Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
- LookWhere? Efficient Visual Recognition by Learning Where to Look and What to See from Self-Supervision
- Model Editing for Vision Transformers
- Multi-Kernel Correlation-Attention Vision Transformer for Enhanced Contextual Understanding and Multi-Scale Integration
- Normalize Filters! Classical Wisdom for Deep Vision
- PLANA3R: Zero-shot Metric Planar 3D Reconstruction via Feed-forward Planar Splatting
- Polyline Path Masked Attention for Vision Transformer
- Pruning-Robust Mamba with Asymmetric Multi-Scale Scanning Paths
- Randomized-MLP Regularization Improves Domain Adaptation and Interpretability in DINOv2
- Revisiting Residual Connections: Orthogonal Updates for Stable and Efficient Deep Networks
- RoMA: Scaling up Mamba-based Foundation Models for Remote Sensing
- SHF: Symmetrical Hierarchical Forest with Pretrained Vision Transformer Encoder for High-Resolution Medical Segmentation
- Scalable Neural Network Geometric Robustness Validation via Hölder Optimisation
- Sinusoidal Initialization, Time for a New Start
- SonoGym: High Performance Simulation for Challenging Surgical Tasks with Robotic Ultrasound
- Structured Initialization for Vision Transformers
- TRUST: Test-Time Refinement using Uncertainty-Guided SSM Traverses
- TreeFinder: A US-Scale Benchmark Dataset for Individual Tree Mortality Monitoring Using High-Resolution Aerial Imagery
- Vision Transformers Don't Need Trained Registers
- Vision Transformers with Self-Distilled Registers