benchmarks
Standardized tests and datasets used to evaluate and compare the performance of machine learning models, essential for measuring progress and guiding research.
- Advancing Expert Specialization for Better MoE
- Advancing Expert Specialization for Better MoE
- Alleviating Hallucinations in Large Language Models through Multi-Model Contrastive Decoding and Dynamic Hallucination Detection
- Augmenting Biological Fitness Prediction Benchmarks with Landscapes Features from GraphFLA
- BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
- CausalVTG: Towards Robust Video Temporal Grounding via Causal Inference
- Chain of Execution Supervision Promotes General Reasoning in Large Language Models
- Deep Tree Tensor Networks
- DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
- Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking
- Diffusion-Driven Two-Stage Active Learning for Low-Budget Semantic Segmentation
- DisMo: Disentangled Motion Representations for Open-World Motion Transfer
- EngiBench: A Framework for Data-Driven Engineering Design Research
- Estimating Model Performance Under Covariate Shift Without Labels
- Fantastic Bugs and Where to Find Them in AI Benchmarks
- Find your Needle: Small Object Image Retrieval via Multi-Object Attention Optimization
- FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
- Flow Matching Neural Processes
- Geometric Imbalance in Semi-Supervised Node Classification
- InFlux: A Benchmark for Self-Calibration of Dynamic Intrinsics of Video Cameras
- InfMasking: Unleashing Synergistic Information by Contrastive Multimodal Interactions
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- L-MTP: Leap Multi-Token Prediction Beyond Adjacent Context for Large Language Models
- Large Language Diffusion Models
- Large Language Diffusion Models
- Learning Robust Vision-Language Models from Natural Latent Spaces
- LogicTree: Improving Complex Reasoning of LLMs via Instantiated Multi-step Synthetic Logical Data
- Multi-Agent Reinforcement Learning with Communication-Constrained Priors
- NTKMTL: Mitigating Task Imbalance in Multi-Task Learning from Neural Tangent Kernel Perspective
- Normal-Abnormal Guided Generalist Anomaly Detection
- OCN: Effectively Utilizing Higher-Order Common Neighbors for Better Link Prediction
- On Evaluating Policies for Robust POMDPs
- PAID: Pairwise Angular-Invariant Decomposition for Continual Test-Time Adaptation
- Program Synthesis via Test-Time Transduction
- QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code
- Quantifying and Alleviating Co-Adaptation in Sparse-View 3D Gaussian Splatting
- RIGNO: A Graph-based Framework For Robust And Accurate Operator Learning For PDEs On Arbitrary Domains
- Reaction Prediction via Interaction Modeling of Symmetric Difference Shingle Sets
- RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
- Rectified Point Flow: Generic Point Cloud Pose Estimation
- STree: Speculative Tree Decoding for Hybrid State Space Models
- Scalable Evaluation and Neural Models for Compositional Generalization
- Scaling Speculative Decoding with Lookahead Reasoning
- Self-Generated In-Context Examples Improve LLM Agents for Sequential Decision-Making Tasks
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- SimSort: A Data-Driven Framework for Spike Sorting by Large-Scale Electrophysiology Simulation
- SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
- Smoothed Differentiation Efficiently Mitigates Shattered Gradients in Explanations
- Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
- Spectral Graph Coarsening Using Inner Product Preservation and the Grassmann Manifold
- Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
- Straight-Line Diffusion Model for Efficient 3D Molecular Generation
- SymMaP: Improving Computational Efficiency in Linear Solvers through Symbolic Preconditioning
- ToolRL: Reward is All Tool Learning Needs
- Towards Generalizable Detector for Generated Image
- U-CAN: Unsupervised Point Cloud Denoising with Consistency-Aware Noise2Noise Matching
- UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
- V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative Perception
- VideoChat-R1.5: Visual Test-Time Scaling to Reinforce Multimodal Reasoning by Iterative Perception
- VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models
- VisualLens: Personalization through Task-Agnostic Visual History
- When No Paths Lead to Rome: Benchmarking Systematic Neural Relational Reasoning
- Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs
- metaTextGrad: Automatically optimizing language model optimizers