cross-attention
A mechanism that allows one sequence of data (like visual features) to attend to another sequence (like text features) in generating outputs, widely used in multimodal models.
- BrainMoE: Cognition Joint Embedding via Mixture-of-Expert Towards Robust Brain Foundation Model
- CALM: Culturally Self-Aware Language Models
- CQ-DINO: Mitigating Gradient Dilution via Category Queries for Vast Vocabulary Object Detection
- Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
- Future Link Prediction Without Memory or Aggregation
- GyroSwin: 5D Surrogates for Gyrokinetic Plasma Turbulence Simulations
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
- LUNA: Efficient and Topology-Agnostic Foundation Model for EEG Signal Analysis
- OPTFM: A Scalable Multi-View Graph Transformer for Hierarchical Pre-Training in Combinatorial Optimization
- One for All: Universal Topological Primitive Transfer for Graph Structure Learning
- PhySense: Sensor Placement Optimization for Accurate Physics Sensing
- Point-MaDi: Masked Autoencoding with Diffusion for Point Cloud Pre-training
- SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought
- SRSR: Enhancing Semantic Accuracy in Real-World Image Super-Resolution with Spatially Re-Focused Text-Conditioning
- Unsupervised Learning for Optimal Transport plan prediction between unbalanced graphs
- WaveAR: Wavelet-Aware Continuous Autoregressive Diffusion for Accurate Human Motion Prediction