empirical validation
The process of confirming the effectiveness of an AI model through experimentation and real-world application, ensuring that theoretical claims hold true.
- $\texttt{BetaConform}$: Efficient MAP Estimation of LLM Ensemble Judgment Performance with Prior Transfer
- A Cramér–von Mises Approach to Incentivizing Truthful Data Sharing
- A Theoretical Framework for Grokking: Interpolation followed by Riemannian Norm Minimisation
- A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders
- A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders
- AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation
- Anchor-based Maximum Discrepancy for Relative Similarity Testing
- Angular Constraint Embedding via SpherePair Loss for Constrained Clustering
- Balancing Positive and Negative Classification Error Rates in Positive-Unlabeled Learning
- Bernstein–von Mises for Adaptively Collected Data
- Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
- Can DPO Learn Diverse Human Values? A Theoretical Scaling Law
- DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
- Deep Edge Filter: Return of the Human-Crafted Layer in Deep Learning
- Disentangling misreporting from genuine adaptation in strategic settings: a causal approach
- Do Neural Networks Need Gradient Descent to Generalize? A Theoretical Study
- Dynamics of Spontaneous Topic Changes in Next Token Prediction with Self-Attention
- Efficient Verified Unlearning For Distillation
- Escaping Collapse: The Strength of Weak Data for Large Language Model Training
- Evaluating and Learning Optimal Dynamic Treatment Regimes under Truncation by Death
- Exploring Structural Degradation in Dense Representations for Self-supervised Learning
- From Softmax to Score: Transformers Can Effectively Implement In-Context Denoising Steps
- Generalizable Insights for Graph Transformers in Theory and Practice
- Generalization Error Analysis for Selective State-Space Models Through the Lens of Attention
- How Data Mixing Shapes In-Context Learning: Asymptotic Equivalence for Transformers with MLPs
- How Does Sequence Modeling Architecture Influence Base Capabilities of Pre-trained Language Models? Exploring Key Architecture Design Principles to Avoid Base Capabilities Degradation
- Learning to Zoom with Anatomical Relations for Medical Structure Detection
- Learning-Augmented Online Bipartite Fractional Matching
- Limitations of Normalization in Attention
- Linearization Explains Fine-Tuning in Large Language Models
- Measuring and Controlling Solution Degeneracy across Task-Trained Recurrent Neural Networks
- Mixed-Sample SGD: an End-to-end Analysis of Supervised Transfer Learning
- MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
- Network two-sample test for block models
- Neural Collapse in Cumulative Link Models for Ordinal Regression: An Analysis with Unconstrained Feature Model
- Omnipresent Yet Overlooked: Heat Kernels in Combinatorial Bayesian Optimization
- On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
- On Linear Mode Connectivity of Mixture-of-Experts Architectures
- On Linear Mode Connectivity of Mixture-of-Experts Architectures
- Online Two-Stage Submodular Maximization
- Optimal Estimation of the Best Mean in Multi-Armed Bandits
- Pairwise Calibrated Rewards for Pluralistic Alignment
- Perturbation Bounds for Low-Rank Inverse Approximations under Noise
- Planning and Learning in Average Risk-aware MDPs
- Reliable Decision‑Making via Calibration‑Oriented Retrieval‑Augmented Generation
- Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
- Scaling Diffusion Transformers Efficiently via $\mu$P
- Shapley-Based Data Valuation for Weighted $k$-Nearest Neighbors
- Size-adaptive Hypothesis Testing for Fairness
- Spectral Conditioning of Attention Improves Transformer Performance
- Test-Time Adaptation by Causal Trimming
- Toward Interpretable Evaluation Measures for Time Series Segmentation
- Treatment Effect Estimation for Optimal Decision-Making
- TreeSynth: Synthesizing Diverse Data from Scratch via Tree-Guided Subspace Partitioning
- True Impact of Cascade Length in Contextual Cascading Bandits
- Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
- Unified Scaling Laws for Compressed Representations
- Variational Learning Finds Flatter Solutions at the Edge of Stability
- Visual Instruction Bottleneck Tuning
- What Really is a Member? Discrediting Membership Inference via Poisoning
- What do you know? Bayesian knowledge inference for navigating agents
- When Does Closeness in Distribution Imply Representational Similarity? An Identifiability Perspective
- Zero-Shot Context Generalization in Reinforcement Learning from Few Training Contexts