speedup
A measure of how much faster a particular computation or algorithm runs compared to a baseline method. In AI, speedup is often pursued through model optimization or efficient algorithm design to enhance practical deployment.
- A Difference-of-Convex Functions Approach to Energy-Based Iterative Reasoning
- AlgoTune: Can Language Models Speed Up General-Purpose Numerical Programs?
- CAT: Circular-Convolutional Attention for Sub-Quadratic Transformers
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- E2Former: An Efficient and Equivariant Transformer with Linear-Scaling Tensor Products
- FlashBias: Fast Computation of Attention with Bias
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- NFIG: Multi-Scale Autoregressive Image Generation via Frequency Ordering
- ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
- R-KV: Redundancy-aware KV Cache Compression for Reasoning Models
- SPOT: Scalable Policy Optimization with Trees for Markov Decision Processes
- Scaling Speculative Decoding with Lookahead Reasoning
- Smoothed Differentiation Efficiently Mitigates Shattered Gradients in Explanations
- SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning
- Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
- SurfelSplat: Learning Efficient and Generalizable Gaussian Surfel Representations for Sparse-View Surface Reconstruction
- Training-Free Efficient Video Generation via Dynamic Token Carving
- Twilight: Adaptive Attention Sparsity with Hierarchical Top-$p$ Pruning
- Yggdrasil: Bridging Dynamic Speculation and Static Runtime for Latency-Optimal Tree-Based LLM Decoding