inference overhead
The additional computational burden incurred when making predictions using trained models, often due to model complexity or inefficient data processing. Reducing inference overhead is important for real-time applications.
- Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
- ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
- ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
- Learning to Focus: Causal Attention Distillation via Gradient‐Guided Token Pruning
- LoMix: Learnable Weighted Multi-Scale Logits Mixing for Medical Image Segmentation
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think