flops reduction
The process of minimizing the number of floating-point operations per second (FLOPs) required for a model to improve computational efficiency and speed.
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Diffusion on Demand: Selective Caching and Modulation for Efficient Generation
- FastVID: Dynamic Density Pruning for Fast Video Large Language Models
- Increasing the Utility of Synthetic Images through Chamfer Guidance
- LookWhere? Efficient Visual Recognition by Learning Where to Look and What to See from Self-Supervision
- Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
- SparseDiT: Token Sparsification for Efficient Diffusion Transformer
- Vision-centric Token Compression in Large Language Model