multi-head self-attention
- Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
- Model Editing for Vision Transformers
- OLinear: A Linear Model for Time Series Forecasting in Orthogonally Transformed Domain
- Predicting Functional Brain Connectivity with Context-Aware Deep Neural Networks
- Who Reasons in the Large Language Models?