performance degradation
A decline in an AI model's predictive capability or efficacy, often due to environmental changes, data shifts, or overfitting.
- A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
- Accurate KV Cache Eviction via Anchor Direction Projection for Efficient LLM Inference
- An Evidence-Based Post-Hoc Adjustment Framework for Anomaly Detection Under Data Contamination
- Balanced Conic Rectified Flow
- Benchmarking Retrieval-Augmented Multimomal Generation for Document Question Answering
- CORAL: Disentangling Latent Representations in Long-Tailed Diffusion
- ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
- Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning
- DIFFSSR: Stereo Image Super-resolution Using Differential Transformer
- Delta Attention: Fast and Accurate Sparse Attention Inference by Delta Correction
- DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration
- Distributional Adversarial Attacks and Training in Deep Hedging
- DynaPipe: Dynamic Layer Redistribution for Efficient Serving of LLMs with Pipeline Parallelism
- Estimating Model Performance Under Covariate Shift Without Labels
- Flexible Realignment of Language Models
- GLNCD: Graph-Level Novel Category Discovery
- HiMoLE: Towards OOD-Robust LoRA via Hierarchical Mixture of Experts
- Improving Generalization of Neural Combinatorial Optimization for Vehicle Routing Problems via Test-Time Projection Learning
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- LASeR: Learning to Adaptively Select Reward Models with Multi-Arm Bandits
- Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
- Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression
- LoRA vs Full Fine-tuning: An Illusion of Equivalence
- MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions
- Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities
- Mixture of Scope Experts at Test: Generalizing Deeper Graph Neural Networks with Shallow Variants
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models
- Normalize Filters! Classical Wisdom for Deep Vision
- OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
- PoGDiff: Product-of-Gaussians Diffusion Models for Imbalanced Text-to-Image Generation
- Probabilistic Token Alignment for Large Language Model Fusion
- Pruning Spurious Subgraphs for Graph Out-of-Distribution Generalization
- Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization
- REOBench: Benchmarking Robustness of Earth Observation Foundation Models
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation Delays
- Rectifying Soft-Label Entangled Bias in Long-Tailed Dataset Distillation
- RefLoRA: Refactored Low-Rank Adaptation for Efficient Fine-Tuning of Large Models
- Remarkable Robustness of LLMs: Stages of Inference?
- Restoring Pruned Large Language Models via Lost Component Compensation
- Robust Minimax Boosting with Performance Guarantees
- SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation
- SMMILE: An expert-driven benchmark for multimodal medical in-context learning
- SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
- Self Iterative Label Refinement via Robust Unlabeled Learning
- Self-Verification Provably Prevents Model Collapse in Recursive Synthetic Training
- SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
- SilentStriker: Toward Stealthy Bit-Flip Attacks on Large Language Models
- Simple Distillation for One-Step Diffusion Models
- Stable Gradients for Stable Learning at Scale in Deep Reinforcement Learning
- Statistically Valid Post-Deployment Monitoring Should Be Standard for AI-Based Digital Health
- Taming Adversarial Constraints in CMDPs
- Temporal-Difference Variational Continual Learning
- Test-Time Adaptation by Causal Trimming
- The Emergence of Abstract Thought in Large Language Models Beyond Any Language
- Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
- Through the Lens: Benchmarking Deepfake Detectors Against Moiré-Induced Distortions
- Time-Masked Transformers with Lightweight Test-Time Adaptation for Neural Speech Decoding
- TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration
- Training Robust Graph Neural Networks by Modeling Noise Dependencies
- Truth over Tricks: Measuring and Mitigating Shortcut Learning in Misinformation Detection
- Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
- VORTA: Efficient Video Diffusion via Routing Sparse Attention
- Visual Instruction Bottleneck Tuning
- What Really is a Member? Discrediting Membership Inference via Poisoning
- When Models Don’t Collapse: On the Consistency of Iterative MLE
- When Thinking Drifts: Evidential Grounding for Robust Video Reasoning