memory efficiency
The effectiveness of an AI algorithm in utilizing memory resources, crucial for deploying models on devices with limited computational capabilities.
- 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
- ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training
- AltLoRA: Towards Better Gradient Approximation in Low-Rank Adaptation with Alternating Projections
- Binary Quadratic Quantization: Beyond First-Order Quantization for Real-Valued Matrix Compression
- CALM-PDE: Continuous and Adaptive Convolutions for Latent Space Modeling of Time-dependent PDEs
- Computation and Memory-Efficient Model Compression with Gradient Reweighting
- E-BATS: Efficient Backpropagation-Free Test-Time Adaptation for Speech Foundation Models
- EUGens: Efficient, Unified and General Dense Layers
- Fira: Can We Achieve Full-rank Training of LLMs Under Low-rank Constraint?
- Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
- Masked Gated Linear Unit
- MoFo: Empowering Long-term Time Series Forecasting with Periodic Pattern Modeling
- On Geometry-Enhanced Parameter-Efficient Fine-Tuning for 3D Scene Segmentation
- PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
- Precise Diffusion Inversion: Towards Novel Samples and Few-Step Models
- REP: Resource-Efficient Prompting for Rehearsal-Free Continual Learning
- SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training
- Scaling Embedding Layers in Language Models
- Simple Distillation for One-Step Diffusion Models
- Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning
- Streaming Stochastic Submodular Maximization with On-Demand User Requests
- SubTrack++ : Gradient Subspace Tracking for Scalable LLM Training
- Ultra-high Resolution Watermarking Framework Resistant to Extreme Cropping and Scaling
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
- Vision-centric Token Compression in Large Language Model
- xLSTM-Mixer: Multivariate Time Series Forecasting by Mixing via Scalar Memories