post-training quantization
Post-training quantization is a technique that reduces the model size and computational requirements after training by converting weights and activations to lower precision formats without significant loss of accuracy.
- $\text{S}^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- Binary Quadratic Quantization: Beyond First-Order Quantization for Real-Valued Matrix Compression
- ESCA: Enabling Seamless Codec Avatar Execution through Algorithm and Hardware Co-Optimization for Virtual Reality
- FALQON: Accelerating LoRA Fine-tuning with Low-Bit Floating-Point Arithmetic
- GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers
- Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
- Point4Bit: Post Training 4-bit Quantization for Point Cloud 3D Detection
- Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
- QBasicVSR: Temporal Awareness Adaptation Quantization for Video Super-Resolution
- QSCA: Quantization with Self-Compensating Auxiliary for Monocular Depth Estimation
- VETA-DiT: Variance-Equalized and Temporally Adaptive Quantization for Efficient 4-bit Diffusion Transformers