large-scale datasets
Large-scale datasets refer to extensive collections of annotated examples that are utilized for training machine learning models. They provide diverse and comprehensive training material, essential for building robust models capable of generalizing across various contexts.
- 4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos
- A Closed-Form Solution for Fast and Reliable Adaptive Testing
- ChemPile: A 250 GB Diverse and Curated Dataset for Chemical Foundation Models
- Dynamic Algorithm for Explainable $k$-medians Clustering under $\ell_p$ Norm
- FlexEvent: Towards Flexible Event-Frame Object Detection at Varying Operational Frequencies
- In Silico Mapping of Visual Categorical Selectivity Across the Whole Brain
- Leader360V: A Large-scale, Real-world 360 Video Dataset for Multi-task Learning in Diverse Environment
- Learning Efficient Fuse-and-Refine for Feed-Forward 3D Gaussian Splatting
- Nemotron-CLIMB: Clustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
- Projecting Assumptions: The Duality Between Sparse Autoencoders and Concept Geometry
- STSBench: A Large-Scale Dataset for Modeling Neuronal Activity in the Dorsal Stream of Primate Visual Cortex
- Scalable, Explainable and Provably Robust Anomaly Detection with One-Step Flow Matching
- Training-Free Safe Denoisers for Safe Use of Diffusion Models
- Turbocharging Gaussian Process Inference with Approximate Sketch-and-Project
- Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains
- scMRDR: A scalable and flexible framework for unpaired single-cell multi-omics data integration