state-of-the-art performance
This term refers to the highest level of performance achieved by a model on a specific benchmark or task, representing the cutting-edge capabilities of AI systems at a given time. It indicates that the model outperforms all previous methodologies and setups in terms of accuracy, efficiency, or other relevant metrics.
- 3D Gaussian Splatting based Scene-independent Relocalization with Unidirectional and Bidirectional Feature Fusion
- 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
- A Difference-of-Convex Functions Approach to Energy-Based Iterative Reasoning
- A Diffusion Model for Regular Time Series Generation from Irregular Data with Completion and Masking
- A Fair Federated Learning Method for Handling Client Participation Probability Inconsistencies in Heterogeneous Environments
- A Minimalistic Unified Framework for Incremental Learning across Image Restoration Tasks
- ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation
- Adaptive Context Length Optimization with Low-Frequency Truncation for Multi-Agent Reinforcement Learning
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling
- Adaptive Time Encoding for Irregular Multivariate Time-Series Classification
- AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
- AnaCP: Toward Upper-Bound Continual Learning via Analytic Contrastive Projection
- AnimateQR: Bridging Aesthetics and Functionality in Dynamic QR Code Generation
- ArchCAD-400K: A Large-Scale CAD drawings Dataset and New Baseline for Panoptic Symbol Spotting
- AttentionPredictor: Temporal Patterns Matter for KV Cache Compression
- AutoPartGen: Autoregressive 3D Part Generation and Discovery
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Bio-Inspired Image Restoration
- BioCG: Constrained Generative Modeling for Biochemical Interaction Prediction
- Causal LLM Routing: End-to-End Regret Minimization from Observational Data
- Chain-of-Retrieval Augmented Generation
- Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search
- CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching
- Conditional Diffusion Anomaly Modeling on Graphs
- CrossAD: Time Series Anomaly Detection with Cross-scale Associations and Cross-window Modeling
- DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- DOVTrack: Data-Efficient Open-Vocabulary Tracking
- DSRF: A Dynamic and Scalable Reasoning Framework for Solving RPMs
- Degradation-Aware Dynamic Schrödinger Bridge for Unpaired Image Restoration
- Dependency Parsing is More Parameter-Efficient with Normalization
- DiffEye: Diffusion-Based Continuous Eye-Tracking Data Generation Conditioned on Natural Images
- Diffusion Feature Field for Text-based 3D Editing with Gaussian Splatting
- Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
- Distilling LLM Prior to Flow Model for Generalizable Agent’s Imagination in Object Goal Navigation
- DitHub: A Modular Framework for Incremental Open-Vocabulary Object Detection
- Dual-Space Semantic Synergy Distillation for Continual Learning of Unlabeled Streams
- DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models
- DuetGraph: Coarse-to-Fine Knowledge Graph Reasoning with Dual-Pathway Global-Local Fusion
- Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
- E-MoFlow: Learning Egomotion and Optical Flow from Event Data via Implicit Regularization
- ELDET: Early-Learning Distillation with Noisy Labels for Object Detection
- Efficient Data Selection at Scale via Influence Distillation
- Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
- Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
- Exploring the Design Space of Diffusion Bridge Models
- Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
- FIPER: Factorized Features for Robust Image Super-Resolution and Compression
- Faithful Dynamic Imitation Learning from Human Intervention with Dynamic Regret Minimization
- FastVID: Dynamic Density Pruning for Fast Video Large Language Models
- Feed-Forward Bullet-Time Reconstruction of Dynamic Scenes from Monocular Videos
- Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments
- GPSToken: Gaussian Parameterized Spatially-adaptive Tokenization for Image Representation and Generation
- GeoRemover: Removing Objects and Their Causal Visual Artifacts
- Hadamax Encoding: Elevating Performance in Model-Free Atari
- Harnessing Feature Resonance under Arbitrary Target Alignment for Out-of-Distribution Node Detection
- High-order Equivariant Flow Matching for Density Functional Theory Hamiltonian Prediction
- Hybrid Boundary Physics-Informed Neural Networks for Solving Navier-Stokes Equations with Complex Boundary
- Improving Task-Specific Multimodal Sentiment Analysis with General MLLMs via Prompting
- Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference
- InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- InstructHOI: Context-Aware Instruction for Multi-Modal Reasoning in Human-Object Interaction Detection
- JanusDNA: A Powerful Bi-directional Hybrid DNA Foundation Model
- Joint Relational Database Generation via Graph-Conditional Diffusion Models
- LLM Meeting Decision Trees on Tabular Data
- LaRes: Evolutionary Reinforcement Learning with LLM-based Adaptive Reward Search
- Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
- Learning Multi-Source and Robust Representations for Continual Learning
- Learning Temporal 3D Semantic Scene Completion via Optical Flow Guidance
- Learning from Interval Targets
- Less is More: Unlocking Specialization of Time Series Foundation Models via Structured Pruning
- Leveraging Depth and Language for Open-Vocabulary Domain-Generalized Semantic Segmentation
- MEMOIR: Lifelong Model Editing with Minimal Overwrite and Informed Retention for LLMs
- Mellow: a small audio language model for reasoning
- Mesh-RFT: Enhancing Mesh Generation via Fine-grained Reinforcement Fine-Tuning
- MiniMax-Remover: Taming Bad Noise Helps Video Object Removal
- MoEMeta: Mixture-of-Experts Meta Learning for Few-Shot Relational Learning
- MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
- MobileUse: A Hierarchical Reflection-Driven GUI Agent for Autonomous Mobile Operation
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
- Multimodal Tabular Reasoning with Privileged Structured Information
- NTKMTL: Mitigating Task Imbalance in Multi-Task Learning from Neural Tangent Kernel Perspective
- Native-Resolution Image Synthesis
- Navigating the MIL Trade-Off: Flexible Pooling for Whole Slide Image Classification
- Nemotron-CLIMB: Clustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
- No Object Is an Island: Enhancing 3D Semantic Segmentation Generalization with Diffusion Models
- OmniCast: A Masked Latent Diffusion Model for Weather Forecasting Across Time Scales
- Oryx: a Scalable Sequence Model for Many-Agent Coordination in Offline MARL
- Out-of-Distribution Generalized Graph Anomaly Detection with Homophily-aware Environment Mixup
- Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- PPMStereo: Pick-and-Play Memory Construction for Consistent Dynamic Stereo Matching
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Perturb a Model, Not an Image: Towards Robust Privacy Protection via Anti-Personalized Diffusion Models
- PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
- Quantization-Free Autoregressive Action Transformer
- RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis
- RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks
- ROOT: Rethinking Offline Optimization as Distributional Translation via Probabilistic Bridge
- Raw2Drive: Reinforcement Learning with Aligned World Models for End-to-End Autonomous Driving (in CARLA v2)
- Real-World Adverse Weather Image Restoration via Dual-Level Reinforcement Learning with High-Quality Cold Start
- Rectified Point Flow: Generic Point Cloud Pose Estimation
- Recurrent Attention-based Token Selection for Efficient Streaming Video-LLMs
- Regression-adjusted Monte Carlo Estimators for Shapley Values and Probabilistic Values
- Return of ChebNet: Understanding and Improving an Overlooked GNN on Long Range Tasks
- Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
- Riemannian Flow Matching for Brain Connectivity Matrices via Pullback Geometry
- Rig3R: Rig-Aware Conditioning and Discovery for 3D Reconstruction
- Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
- Robust Label Proportions Learning
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SEAL: Semantic-Aware Hierarchical Learning for Generalized Category Discovery
- SGN: Shifted Window-Based Hierarchical Variable Grouping for Multivariate Time Series Classification
- SIU3R: Simultaneous Scene Understanding and 3D Reconstruction Beyond Feature Alignment
- STNet: Spectral Transformation Network for Solving Operator Eigenvalue Problem
- SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
- Scalable Valuation of Human Feedback through Provably Robust Model Alignment
- ScaleDiff: Higher-Resolution Image Synthesis via Efficient and Model-Agnostic Diffusion
- Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
- Self-supervised Blending Structural Context of Visual Molecules for Robust Drug Interaction Prediction
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Siegel Neural Networks
- SnapMoGen: Human Motion Generation from Expressive Texts
- Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling
- Spiking Neural Networks Need High-Frequency Information
- Split Gibbs Discrete Diffusion Posterior Sampling
- Straight-Line Diffusion Model for Efficient 3D Molecular Generation
- Surface-Aware Feed-Forward Quadratic Gaussian for Frame Interpolation with Large Motion
- SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking
- SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
- TabSTAR: A Tabular Foundation Model for Tabular Data with Text Fields
- Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
- TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
- Text-Aware Real-World Image Super-Resolution via Diffusion Model with Joint Segmentation Decoders
- The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
- This Time is Different: An Observability Perspective on Time Series Foundation Models
- Time Series Generation Under Data Scarcity: A Unified Generative Modeling Approach
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- Time-o1: Time-Series Forecasting Needs Transformed Label Alignment
- TopoPoint: Enhance Topology Reasoning via Endpoint Detection in Autonomous Driving
- Towards Accurate Time Series Forecasting via Implicit Decoding
- Uncertainty Estimation by Flexible Evidential Deep Learning
- Understanding and Improving Fast Adversarial Training against $l_0$ Bounded Perturbations
- Unified 2D-3D Discrete Priors for Noise-Robust and Calibration-Free Multiview 3D Human Pose Estimation
- Unifying and Enhancing Graph Transformers via a Hierarchical Mask Framework
- Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
- Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains
- VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree
- VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning
- VideoMAR: Autoregressive Video Generation with Continuous Tokens
- ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models
- Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
- d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
- 🎧MOSPA: Human Motion Generation Driven by Spatial Audio