convergence
The process by which an iterative algorithm approaches a stable solution or a specific value, which is important in both optimization and training phases.
- A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation
- A multiscale analysis of mean-field transformers in the moderate interaction regime
- A multiscale analysis of mean-field transformers in the moderate interaction regime
- Accelerated Evolving Set Processes for Local PageRank Computation
- Adaptive 3D Reconstruction via Diffusion Priors and Forward Curvature-Matching Likelihood Updates
- Adaptive Riemannian ADMM for Nonsmooth Optimization: Optimal Complexity without Smoothing
- Any-stepsize Gradient Descent for Separable Data under Fenchel–Young Losses
- Asymptotically Stable Quaternion-valued Hopfield-structured Neural Network with Periodic Projection-based Supervised Learning Rules
- COALA: Numerically Stable and Efficient Framework for Context-Aware Low-Rank Approximation
- Conditioning Matters: Training Diffusion Policies is Faster Than You Think
- Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning
- Convergence of the Gradient Flow for Shallow ReLU Networks on Weakly Interacting Data
- Convex Potential Mirror Langevin Algorithm for Efficient Sampling of Energy-Based Models
- Dynamical Properties of Tokens in Self-Attention and Effects of Positional Encoding
- Efficient Federated Learning against Byzantine Attacks and Data Heterogeneity via Aggregating Normalized Gradients
- Error Feedback under $(L_0,L_1)$-Smoothness: Normalization and Momentum
- Evolutionary Multi-View Classification via Eliminating Individual Fitness Bias
- Explaining the Law of Supply and Demand via Online Learning
- FLOWING: Implicit Neural Flows for Structure-Preserving Morphing
- FSNet: Feasibility-Seeking Neural Network for Constrained Optimization with Guarantees
- FedGPS: Statistical Rectification Against Data Heterogeneity in Federated Learning
- Fisher meets Feynman: score-based variational inference with a product of experts
- From stability of Langevin diffusion to convergence of proximal MCMC for non-log-concave sampling
- Information Theoretic Learning for Diffusion Models with Warm Start
- Just One Layer Norm Guarantees Stable Extrapolation
- LORE: Lagrangian-Optimized Robust Embeddings for Visual Encoders
- Learning Sparse Approximate Inverse Preconditioners for Conjugate Gradient Solvers on GPUs
- Learning from Delayed Feedback in Games via Extra Prediction
- Metropolis-Hastings Sampling for 3D Gaussian Reconstruction
- Momentum Multi-Marginal Schrödinger Bridge Matching
- Non-convex entropic mean-field optimization via Best Response flow
- Optimal and Provable Calibration in High-Dimensional Binary Classification: Angular Calibration and Platt Scaling
- PAC-Bayes Bounds for Multivariate Linear Regression and Linear Autoencoders
- PROFIT: A Specialized Optimizer for Deep Fine Tuning
- Planning and Learning in Average Risk-aware MDPs
- Projection-based Lyapunov method for fully heterogeneous weakly-coupled MDPs
- Purifying Shampoo: Investigating Shampoo's Heuristics by Decomposing its Preconditioner
- ReDi: Rectified Discrete Flow
- RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models
- Rethinking Gradient Step Denoiser: Towards Truly Pseudo-Contractive Operator
- Risk-Averse Constrained Reinforcement Learning with Optimized Certainty Equivalents
- SAD Neural Networks: Divergent Gradient Flows and Asymptotic Optimality via o-minimal Structures
- Searching Efficient Semantic Segmentation Architectures via Dynamic Path Selection
- Sinusoidal Initialization, Time for a New Start
- Spike-timing-dependent Hebbian learning as noisy gradient descent
- Split Gibbs Discrete Diffusion Posterior Sampling
- Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
- The Primacy of Magnitude in Low-Rank Adaptation
- Tight Lower Bounds and Improved Convergence in Performative Prediction
- Towards Understanding Transformers in Learning Random Walks
- Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning
- Tree Ensemble Explainability through the Hoeffding Functional Decomposition and TreeHFD Algorithm
- UFT: Unifying Supervised and Reinforcement Fine-Tuning
- Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
- Unveiling the Power of Multiple Gossip Steps: A Stability-Based Generalization Analysis in Decentralized Training