resource-constrained devices
- Dynamical Low-Rank Compression of Neural Networks with Robustness under Adversarial Attacks
- Dynamical Low-Rank Compression of Neural Networks with Robustness under Adversarial Attacks
- Efficient and Generalizable Mixed-Precision Quantization via Topological Entropy
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- The Omni-Expert: A Computationally Efficient Approach to Achieve a Mixture of Experts in a Single Expert Model