empirical evaluations
Empirical evaluations entail systematic observation or experimentation to assess the performance of AI models and methodologies. These evaluations rely on data-driven metrics and benchmarks to validate theoretical claims.
- A Partition Cover Approach to Tokenization
- Adaptive Prediction-Powered AutoEval with Reliability and Efficiency Guarantees
- An Information-theoretical Framework for Understanding Out-of-distribution Detection with Pretrained Vision-Language Models
- Attention! Your Vision Language Model Could Be Maliciously Manipulated
- C-SafeGen: Certified Safe LLM Generation with Claim-Based Streaming Guardrails
- Can We Infer Confidential Properties of Training Data from LLMs?
- Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
- Deep learning for continuous-time stochastic control with jumps
- Differentiable Constraint-Based Causal Discovery
- Discovering Important Experts for Mixture-of-Experts Models Pruning Through a Theoretical Perspective
- Distances for Markov chains from sample streams
- Efficient Adaptive Federated Optimization
- Efficient and Near-Optimal Algorithm for Contextual Dueling Bandits with Offline Regression Oracles
- Exploration via Feature Perturbation in Contextual Bandits
- FairNet: Dynamic Fairness Correction without Performance Loss via Contrastive Conditional LoRA
- Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms
- Forecasting in Offline Reinforcement Learning for Non-stationary Environments
- FuncGenFoil: Airfoil Generation and Editing Model in Function Space
- Gradient-Guided Epsilon Constraint Method for Online Continual Learning
- H-SPLID: HSIC-based Saliency Preserving Latent Information Decomposition
- How Memory in Optimization Algorithms Implicitly Modifies the Loss
- IOSTOM: Offline Imitation Learning from Observations via State Transition Occupancy Matching
- Improving Perturbation-based Explanations by Understanding the Role of Uncertainty Calibration
- Incentivizing Truthful Language Models via Peer Elicitation Games
- Infrequent Exploration in Linear Bandits
- InvisibleInk: High-Utility and Low-Cost Text Generation with Differential Privacy
- Is Noise Conditioning Necessary? A Unified Theory of Unconditional Graph Diffusion Models
- KAIROS: Scalable Model-Agnostic Data Valuation
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- LLM Query Scheduling with Prefix Reuse and Latency Constraints
- Learn2Mix: Training Neural Networks Using Adaptive Data Integration
- Learning Across the Gap: Hybrid Multi-armed Bandits with Heterogeneous Offline and Online Data
- Lookahead Routing for Large Language Models
- Low Precision Streaming PCA
- MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search
- Matryoshka Pilot: Learning to Drive Black-Box LLMs with LLMs
- Memory-Integrated Reconfigurable Adapters: A Unified Framework for Settings with Multiple Tasks
- MetaFind: Scene-Aware 3D Asset Retrieval for Coherent Metaverse Scene Generation
- Multi-Expert Distributionally Robust Optimization for Out-of-Distribution Generalization
- NeurIPT: Foundation Model for Neural Interfaces
- Offline imitation learning in $Q^\pi$-realizable MDPs without expert realizability
- Personalized Subgraph Federated Learning with Differentiable Auxiliary Projections
- Proximalized Preference Optimization for Diverse Feedback Types: A Decomposed Perspective on DPO
- Retrieval is Not Enough: Enhancing RAG through Test-Time Critique and Optimization
- S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
- SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training
- Selective Omniprediction and Fair Abstention
- Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families
- Synergy over Discrepancy: A Partition-Based Approach to Multi-Domain LLM Fine-Tuning
- Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
- TimeXL: Explainable Multi-modal Time Series Prediction with LLM-in-the-Loop
- ToolRL: Reward is All Tool Learning Needs
- Towards Identifiability of Hierarchical Temporal Causal Representation Learning
- Train on Pins and Test on Obstacles for Rectilinear Steiner Minimum Tree
- Transformers Learn Faster with Semantic Focus
- Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training
- WebDancer: Towards Autonomous Information Seeking Agency
- When Does Curriculum Learning Help? A Theoretical Perspective