computational overhead
This term refers to the additional computational resources required to perform a particular operation or process in AI models. It includes extra computations needed for certain algorithms compared to the baseline, affecting overall system efficiency and speed.
- A Minimalistic Unified Framework for Incremental Learning across Image Restoration Tasks
- ALTER: All-in-One Layer Pruning and Temporal Expert Routing for Efficient Diffusion Generation
- Accelerating RL for LLM Reasoning with Optimal Advantage Regression
- Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
- AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
- Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
- Architectural and Inferential Inductive Biases for Exchangeable Sequence Modeling
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
- Beyond Random: Automatic Inner-loop Optimization in Dataset Distillation
- Bridging Crypto with ML-based Solvers: the SAT Formulation and Benchmarks
- ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- CogVLA: Cognition-Aligned Vision-Language-Action Models via Instruction-Driven Routing & Sparsification
- CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment
- DUO: No Compromise to Accuracy Degradation
- Dense Backpropagation Improves Training for Sparse Mixture-of-Experts
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- DictPFL: Efficient and Private Federated Learning on Encrypted Gradients
- Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention
- Don't Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention
- Don’t Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
- DynaNav: Dynamic Feature and Layer Selection for Efficient Visual Navigation
- EAReranker: Efficient Embedding Adequacy Assessment for Retrieval Augmented Generation
- EUGens: Efficient, Unified and General Dense Layers
- Efficient Federated Learning against Byzantine Attacks and Data Heterogeneity via Aggregating Normalized Gradients
- Efficient Representativeness-Aware Coreset Selection
- Energy Landscape-Aware Vision Transformers: Layerwise Dynamics and Adaptive Task-Specific Training via Hopfield States
- Enhanced Self-Distillation Framework for Efficient Spiking Neural Network Training
- EquiTabPFN: A Target-Permutation Equivariant Prior Fitted Network
- Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
- FLUX: Efficient Descriptor-Driven Clustered Federated Learning under Arbitrary Distribution Shifts
- Fast Monte Carlo Tree Diffusion: 100× Speedup via Parallel and Sparse Planning
- FastVID: Dynamic Density Pruning for Fast Video Large Language Models
- Frequency-Aware Token Reduction for Efficient Vision Transformer
- Fully Spiking Neural Networks for Unified Frame-Event Object Tracking
- GaussianFusion: Gaussian-Based Multi-Sensor Fusion for End-to-End Autonomous Driving
- Geometry-Aware Collaborative Multi-Solutions Optimizer for Model Fine-Tuning with Parameter Efficiency
- Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
- Hierarchical Implicit Neural Emulators
- Influence Guided Context Selection for Effective Retrieval-Augmented Generation
- LLM Query Scheduling with Prefix Reuse and Latency Constraints
- Language Ranker: A Lightweight Ranking framework for LLM Decoding
- Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
- Learning to Instruct for Visual Instruction Tuning
- Let LRMs Break Free from Overthinking via Self-Braking Tuning
- LoRATv2: Enabling Low-Cost Temporal Modeling in One-Stream Trackers
- MODEL SHAPLEY: Find Your Ideal Parameter Player via One Gradient Backpropagation
- MVSMamba: Multi-View Stereo with State Space Model
- MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization
- Mixture of Inputs: Text Generation Beyond Discrete Token Sampling
- Momentum-SAM: Sharpness Aware Minimization without Computational Overhead
- No Loss, No Gain: Gated Refinement and Adaptive Compression for Prompt Optimization
- OPMapper: Enhancing Open-Vocabulary Semantic Segmentation with Multi-Guidance Information
- OSCAR: One-Step Diffusion Codec Across Multiple Bit-rates
- OpenBox: Annotate Any Bounding Boxes in 3D
- Pan-LUT: Efficient Pan-sharpening via Learnable Look-Up Tables
- Pan-LUT: Efficient Pan-sharpening via Learnable Look-Up Tables
- PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
- Private Zeroth-Order Optimization with Public Data
- Purity Law for Neural Routing Problem Solvers with Enhanced Generalizability
- Q3R: Quadratic Reweighted Rank Regularizer for Effective Low-Rank Training
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization
- RCCDA: Adaptive Model Updates in the Presence of Concept Drift under a Constrained Resource Budget
- Reasoning Planning for Language Models
- RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models
- ReplaceMe: Network Simplification via Depth Pruning and Transformer Block Linearization
- Rescaled Influence Functions: Accurate Data Attribution in High Dimension
- Robust Cross-modal Alignment Learning for Cross-Scene Spatial Reasoning and Grounding
- Robust Integrated Learning and Pauli Noise Mitigation for Parametrized Quantum Circuits
- Robustifying Learning-Augmented Caching Efficiently without Compromising 1-Consistency
- Rotary Masked Autoencoders are Versatile Learners
- SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
- SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
- Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
- Training Language Models to Reason Efficiently
- Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- VETA-DiT: Variance-Equalized and Temporally Adaptive Quantization for Efficient 4-bit Diffusion Transformers
- VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
- ViewCraft3D: High-fidelity and View-Consistent 3D Vector Graphics Synthesis
- When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners