generalization
The ability of an AI model to perform well on unseen data, beyond the examples it was trained on, indicating its robustness and learning efficacy.
- $\textit{HiMaCon:}$ Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data
- 3D-RAD: A Comprehensive 3D Radiology Med-VQA Dataset with Multi-Temporal Analysis and Diverse Diagnostic Tasks
- A Black-Box Debiasing Framework for Conditional Sampling
- A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
- A Practical Guide for Incorporating Symmetry in Diffusion Policy
- A Set of Generalized Components to Achieve Effective Poison-only Clean-label Backdoor Attacks with Collaborative Sample Selection and Triggers
- A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis
- A Unified Stability Analysis of SAM vs SGD: Role of Data Coherence and Emergence of Simplicity Bias
- A2Seek: Towards Reasoning-Centric Benchmark for Aerial Anomaly Understanding
- AMBER: Adaptive Mesh Generation by Iterative Mesh Resolution Prediction
- Adam Reduces a Unique Form of Sharpness: Theoretical Insights Near the Minimizer Manifold
- Adaptive Re-calibration Learning for Balanced Multimodal Intention Recognition
- AlphaDecay: Module-wise Weight Decay for Heavy-Tailed Balancing in LLMs
- An Analysis of Causal Effect Estimation using Outcome Invariant Data Augmentation
- Analyzing Similarity Metrics for Data Selection for Language Model Pretraining
- Axial Neural Networks for Dimension-Free Foundation Models
- Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
- Blindfolded Experts Generalize Better: Insights from Robotic Manipulation and Videogames
- Brain-Informed Fine-Tuning for Improved Multilingual Understanding in Language Models
- Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
- BrainODE: Neural Shape Dynamics for Age- and Disease-aware Brain Trajectories
- Breaking the Batch Barrier (B3) of Contrastive Learning via Smart Batch Mining
- Bridging Equivariant GNNs and Spherical CNNs for Structured Physical Domains
- CSI-Bench: A Large-Scale In-the-Wild Dataset for Multi-task WiFi Sensing
- Can Knowledge-Graph-based Retrieval Augmented Generation Really Retrieve What You Need?
- Channel Matters: Estimating Channel Influence for Multivariate Time Series
- Channel Simulation and Distributed Compression with Ensemble Rejection Sampling
- Characterizing the Expressivity of Fixed-Precision Transformer Language Models
- CoDA: Coordinated Diffusion Noise Optimization for Whole-Body Manipulation of Articulated Objects
- Common Task Framework For a Critical Evaluation of Scientific Machine Learning Algorithms
- Contrastive Representations for Temporal Reasoning
- CroPe: Cross-Modal Semantic Compensation Adaptation for All Adverse Scene Understanding
- Cross-Modal Representational Knowledge Distillation for Enhanced Spike-informed LFP Modeling
- Curriculum Model Merging: Harmonizing Chemical LLMs for Enhanced Cross-Task Generalization
- Curvature Tuning: Provable Training-free Model Steering From a Single Parameter
- Cypher-RI: Reinforcement Learning for Integrating Schema Selection into Cypher Generation
- DETree: DEtecting Human-AI Collaborative Texts via Tree-Structured Hierarchical Representation Learning
- DIPO: Dual-State Images Controlled Articulated Object Generation Powered by Diverse Data
- DON’T NEED RETRAINING: A Mixture of DETR and Vision Foundation Models for Cross-Domain Few-Shot Object Detection
- Deep Value Benchmark: Measuring Whether Models Generalize Deep values or Shallow Preferences
- DeltaPhi: Physical States Residual Learning for Neural Operators in Data-Limited PDE Solving
- DexGarmentLab: Dexterous Garment Manipulation Environment with Generalizable Policy
- Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
- Diffusion-Guided Graph Data Augmentation
- Dimension-free Score Matching and Time Bootstrapping for Diffusion Models
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
- Disentangling Latent Shifts of In-Context Learning with Weak Supervision
- Doodle to Detect: A Goofy but Powerful Approach to Skeleton-based Hand Gesture Recognition
- Double Descent Meets Out-of-Distribution Detection: Theoretical Insights and Empirical Analysis on the Role of Model Complexity
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- ECO: Evolving Core Knowledge for Efficient Transfer
- EVAAA: A Virtual Environment Platform for Essential Variables in Autonomous and Adaptive Agents
- Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs
- EgoBridge: Domain Adaptation for Generalizable Imitation from Egocentric Human Data
- Embracing Contradiction: Theoretical Inconsistency Will Not Impede the Road of Building Responsible AI Systems
- EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
- EvoLM: In Search of Lost Language Model Training Dynamics
- EvoLM: In Search of Lost Language Model Training Dynamics
- Exploiting LLMs for Automatic Hypothesis Assessment via a Logit-Based Calibrated Prior
- Exploring Landscapes for Better Minima along Valleys
- F-Adapter: Frequency-Adaptive Parameter-Efficient Fine-Tuning in Scientific Machine Learning
- FEEL: Quantifying Heterogeneity in Physiological Signals for Generalizable Emotion Recognition
- Fair Deepfake Detectors Can Generalize
- Fast MRI for All: Bridging Access Gaps by Training without Raw Data
- FedRW: Efficient Privacy-Preserving Data Reweighting for Enhancing Federated Learning of Language Models
- Flatness is Necessary, Neural Collapse is Not: Rethinking Generalization via Grokking
- FoGE: Fock Space inspired encoding for graph prompting
- For Better or for Worse, Transformers Seek Patterns for Memorization
- Force Prompting: Video Generation Models Can Learn And Generalize Physics-based Control Signals
- ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
- Fourier Analysis Network
- From Experts to a Generalist: Toward General Whole-Body Control for Humanoid Robots
- From Pose to Muscle: Multimodal Learning for Piano Hand Muscle Electromyography
- From Shortcut to Induction Head: How Data Diversity Shapes Algorithm Selection in Transformers
- From Specificity to Generality: Revisiting Generalizable Artifacts in Detecting Face Deepfakes
- From Style to Facts: Mapping the Boundaries of Knowledge Injection with Finetuning
- Future Link Prediction Without Memory or Aggregation
- GMV: A Unified and Efficient Graph Multi-View Learning Framework
- GOOD: Training-Free Guided Diffusion Sampling for Out-of-Distribution Detection
- GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
- Generalizable Reasoning through Compositional Energy Minimization
- Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers
- Generalizing Verifiable Instruction Following
- Geometry of Decision Making in Language Models
- Global Minimizers of $\ell^p$-Regularized Objectives Yield the Sparsest ReLU Neural Networks
- Glocal Information Bottleneck for Time Series Imputation
- Gradient Variance Reveals Failure Modes in Flow-Based Generative Models
- Gradient-Guided Epsilon Constraint Method for Online Continual Learning
- Gradient-Weight Alignment as a Train-Time Proxy for Generalization in Classification Tasks
- Graph Neural Network Based Action Ranking for Planning
- Grids Often Outperform Implicit Neural Representation at Compressing Dense Signals
- How Different from the Past? Spatio-Temporal Time Series Forecasting with Self-Supervised Deviation Learning
- How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime?
- Human Texts Are Outliers: Detecting LLM-generated Texts via Out-of-distribution Detection
- Human-assisted Robotic Policy Refinement via Action Preference Optimization
- Hybrid-Balance GFlowNet for Solving Vehicle Routing Problems
- Imagined Autocurricula
- Implicit Modeling for Transferability Estimation of Vision Foundation Models
- Information-Theoretic Reward Decomposition for Generalizable RLHF
- InstaInpaint: Instant 3D-Scene Inpainting with Masked Large Reconstruction Model
- JAFAR: Jack up Any Feature at Any Resolution
- Jamais Vu: Exposing the Generalization Gap in Supervised Semantic Correspondence
- JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
- Language Models Can Predict Their Own Behavior
- Large language models can learn and generalize steganographic chain-of-thought under process supervision
- Learning (Approximately) Equivariant Networks via Constrained Optimization
- Learning (Approximately) Equivariant Networks via Constrained Optimization
- Learning Interactive World Model for Object-Centric Reinforcement Learning
- Learning Linear Attention in Polynomial Time
- Learning Linear Attention in Polynomial Time
- Learning Parameterized Skills from Demonstrations
- Learning Pattern-Specific Experts for Time Series Forecasting Under Patch-level Distribution Shift
- Learning Repetition-Invariant Representations for Polymer Informatics
- Learning Robust Vision-Language Models from Natural Latent Spaces
- Learning Skill-Attributes for Transferable Assessment in Video
- Learning Without Augmenting: Unsupervised Time Series Representation Learning via Frame Projections
- Learning to Better Search with Language Models via Guided Reinforced Self-Training
- MLEP: Multi-granularity Local Entropy Patterns for Generalized AI-generated Image Detection
- MMCSBench: A Fine-Grained Benchmark for Large Vision-Language Models in Camouflage Scenes
- MOTION: Multi-Sculpt Evolutionary Coarsening for Federated Continual Graph Learning
- Many Minds, One Goal: Time Series Forecasting via Sub-task Specialization and Inter-agent Cooperation
- MaterialRefGS: Reflective Gaussian Splatting with Multi-view Consistent Material Inference
- MaxSup: Overcoming Representation Collapse in Label Smoothing
- MaxSup: Overcoming Representation Collapse in Label Smoothing
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning
- Mitra: Mixed Synthetic Priors for Enhancing Tabular Foundation Models
- MoEMeta: Mixture-of-Experts Meta Learning for Few-Shot Relational Learning
- Model Editing for Vision Transformers
- Model-Based Policy Adaptation for Closed-Loop End-to-end Autonomous Driving
- MolVision: Molecular Property Prediction with Vision Language Models
- NOVA: A Benchmark for Rare Anomaly Localization and Clinical Reasoning in Brain MRI
- NOVA: A Benchmark for Rare Anomaly Localization and Clinical Reasoning in Brain MRI
- Neptune-X: Active X-to-Maritime Generation for Universal Maritime Object Detection
- Neural Green’s Functions
- Neural Networks for Learnable and Scalable Influence Estimation of Instruction Fine-Tuning Data
- NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
- Normalize Filters! Classical Wisdom for Deep Vision
- Not All Data are Good Labels: On the Self-supervised Labeling for Time Series Forecasting
- OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation
- Object Concepts Emerge from Motion
- On the Bias of Next-Token Predictors Toward Systematically Inefficient Reasoning: A Shortest-Path Case Study
- On the Edge of Memorization in Diffusion Models
- On the Stability and Generalization of Meta-Learning: the Impact of Inner-Levels
- One Filters All: A Generalist Filter For State Estimation
- Online Learning of Pure States is as Hard as Mixed States
- OpenCUA: Open Foundations for Computer-Use Agents
- Optimal Control for Transformer Architectures: Enhancing Generalization, Robustness and Efficiency
- Order-Level Attention Similarity Across Language Models: A Latent Commonality
- Orient Anything V2: Unifying Orientation and Rotation Understanding
- Orientation Matters: Making 3D Generative Models Orientation-Aligned
- Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- PDEfuncta: Spectrally-Aware Neural Representation for PDE Solution Modeling
- PIVNO: Particle Image Velocimetry Neural Operator
- Policy Compatible Skill Incremental Learning via Lazy Learning Interface
- Position: AI Should Sense Better, Not Just Scale Bigger: Adaptive Sensing as a Paradigm Shift
- Position: Require Frontier AI Labs To Release Small "Analog" Models
- Preference-Driven Multi-Objective Combinatorial Optimization with Conditional Computation
- Preventing Shortcuts in Adapter Training via Providing the Shortcuts
- Principled Data Augmentation for Learning to Solve Quadratic Programming Problems
- Principled Long-Tailed Generative Modeling via Diffusion Models
- Purity Law for Neural Routing Problem Solvers with Enhanced Generalizability
- REVE: A Foundation Model for EEG - Adapting to Any Setup with Large-Scale Pretraining on 25,000 Subjects
- RIGNO: A Graph-based Framework For Robust And Accurate Operator Learning For PDEs On Arbitrary Domains
- RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- Rectifying Shortcut Behaviors in Preference-based Reward Learning
- Reparameterized LLM Training via Orthogonal Equivalence Transformation
- Restricted Global-Aware Graph Filters Bridging GNNs and Transformer for Node Classification
- Rethinking Evaluation of Infrared Small Target Detection
- Rethinking the Role of Verbatim Memorization in LLM Privacy
- Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
- Reward-Aware Proto-Representations in Reinforcement Learning
- Rising from Ashes: Generalized Federated Learning via Dynamic Parameter Reset
- Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment
- SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts
- SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
- STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
- Scaling Up Parameter Generation: A Recurrent Diffusion Approach
- Scaling can lead to compositional generalization
- Searching Efficient Semantic Segmentation Architectures via Dynamic Path Selection
- Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation
- Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation
- Segment Anything Model Meets Semi-supervised Medical Image Segmentation: A Novel Perspective
- Self-Guided Hierarchical Exploration for Generalist Foundation Model Web Agents
- Self-Training with Dynamic Weighting for Robust Gradual Domain Adaptation
- Semi-Supervised Regression with Heteroscedastic Pseudo-Labels
- Sequential Multi-Agent Dynamic Algorithm Configuration
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- Sinusoidal Initialization, Time for a New Start
- SnapMoGen: Human Motion Generation from Expressive Texts
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- SolverLLM: Leveraging Test-Time Scaling for Optimization Problem via LLM-Guided Search
- Solving Discrete (Semi) Unbalanced Optimal Transport with Equivalent Transformation Mechanism and KKT-Multiplier Regularization
- Stable Coresets via Posterior Sampling: Aligning Induced and Full Loss Landscapes
- Stochastic Forward-Forward Learning through Representational Dimensionality Compression
- System Prompt Optimization with Meta-Learning
- TS-RAG: Retrieval-Augmented Generation based Time Series Foundation Models are Stronger Zero-Shot Forecaster
- Table as a Modality for Large Language Models
- Text-Aware Real-World Image Super-Resolution via Diffusion Model with Joint Segmentation Decoders
- The Implicit Bias of Structured State Space Models Can Be Poisoned With Clean Labels
- The Quest for Universal Master Key Filters in DS-CNNs
- The Rich and the Simple: On the Implicit Bias of Adam and SGD
- The Structure of Relation Decoding Linear Operators in Large Language Models
- Toward Real-world Text Image Forgery Localization: Structured and Interpretable Data Synthesis
- Towards Generalizable 3D Human Pose Estimation via Ensembles on Flat Loss Landscapes
- Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
- Towards Robust Pseudo-Label Learning in Semantic Segmentation: An Encoding Perspective
- Towards foundational LiDAR world models with efficient latent flow matching
- Training-Free Bayesianization for Low-Rank Adapters of Large Language Models
- TransferBench: Benchmarking Ensemble-based Black-box Transfer Attacks
- Transformers Learn Faster with Semantic Focus
- Transformers are almost optimal metalearners for linear classification
- UFT: Unifying Supervised and Reinforcement Fine-Tuning
- Ultrametric Cluster Hierarchies: I Want ‘em All!
- Uncertainty Estimation by Flexible Evidential Deep Learning
- Uncertainty-Informed Meta Pseudo Labeling for Surrogate Modeling with Limited Labeled Data
- Understanding Representation Dynamics of Diffusion Models via Low-Dimensional Modeling
- Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
- UniTraj: Learning a Universal Trajectory Foundation Model from Billion-Scale Worldwide Traces
- UniZyme: A Unified Protein Cleavage Site Predictor Enhanced with Enzyme Active-Site Knowledge
- Universal Few-shot Spatial Control for Diffusion Models
- Variational Task Vector Composition
- Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision
- VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- Visual Instruction Bottleneck Tuning
- What Can RL Bring to VLA Generalization? An Empirical Study
- When Does Curriculum Learning Help? A Theoretical Perspective
- When No Paths Lead to Rome: Benchmarking Systematic Neural Relational Reasoning
- Whose Instructions Count? Resolving Preference Bias in Instruction Fine-Tuning
- Why Diffusion Models Don’t Memorize: The Role of Implicit Dynamical Regularization in Training
- Why Diffusion Models Don’t Memorize: The Role of Implicit Dynamical Regularization in Training
- Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting
- ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding
- ZEUS: Zero-shot Embeddings for Unsupervised Separation of Tabular Data
- Zero-Shot Context Generalization in Reinforcement Learning from Few Training Contexts