flashattention
An optimized attention mechanism that improves the efficiency of computing attention scores in transformer architectures, reducing computational complexity.
- BlockScan: Detecting Anomalies in Blockchain Transactions
- FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion
- Flash Invariant Point Attention
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments
- PaTH Attention: Position Encoding via Accumulating Householder Transformations
- SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training