quantization
Quantization is the process of reducing the precision of the representation of model parameters (weights) and/or inputs, effectively compressing models for efficient storage and deployment while maintaining performance.
- $\text{S}^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation
- DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization
- Dimensional Collapse in VQVAEs: Evidence and Remedies
- FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion
- G-Net: A Provably Easy Construction of High-Accuracy Random Binary Neural Networks
- Irrational Complex Rotations Empower Low-bit Optimizers
- Latency NMS Attacks: Is It Real Life or Is It Just Fantasy?
- LittleBit: Ultra Low-Bit Quantization via Latent Factorization
- LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning
- MixAT: Combining Continuous and Discrete Adversarial Training for LLMs
- PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models
- PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement
- PolarQuant: Leveraging Polar Transformation for Key Cache Quantization and Decoding Acceleration
- Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- Sparse Meets Dense: Unified Generative Recommendations with Cascaded Sparse-Dense Representations
- Switchable Token-Specific Codebook Quantization For Face Image Compression
- Unified Scaling Laws for Compressed Representations