pre-training
The phase in model training where a model learns general representations from a large dataset before being fine-tuned on a specific task, crucial for transfer learning.
- $\Psi$-Sampler: Initial Particle Sampling for SMC-Based Inference-Time Reward Alignment in Score Models
- Alligat0R: Pre-Training through Covisibility Segmentation for Relative Camera Pose Regression
- BrainMoE: Cognition Joint Embedding via Mixture-of-Expert Towards Robust Brain Foundation Model
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- Cross-Domain Graph Data Scaling: A Showcase with Diffusion Models
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
- EquiTabPFN: A Target-Permutation Equivariant Prior Fitted Network
- EvoLM: In Search of Lost Language Model Training Dynamics
- EvoLM: In Search of Lost Language Model Training Dynamics
- Fira: Can We Achieve Full-rank Training of LLMs Under Low-rank Constraint?
- GRAVER: Generative Graph Vocabularies for Robust Graph Foundation Models Fine-tuning
- GraphTOP: Graph Topology-Oriented Prompting for Graph Neural Networks
- IF-Guide: Influence Function-Guided Detoxification of LLMs
- Large Language Diffusion Models
- Large Language Diffusion Models
- Mean Flows for One-step Generative Modeling
- Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
- Mixture-of-Experts Operator Transformer for Large-Scale PDE Pre-Training
- Model Merging in Pre-training of Large Language Models
- Multimodal 3D Genome Pre-training
- On the Mechanisms of Weak-to-Strong Generalization: A Theoretical Perspective
- Private Zeroth-Order Optimization with Public Data
- Probing Hidden Knowledge Holes in Unlearned LLMs
- Quantifying Task-relevant Similarities in Representations Using Decision Variable Correlations
- Rare Text Semantics Were Always There in Your Diffusion Transformer
- SQS: Enhancing Sparse Perception Models via Query-based Splatting in Autonomous Driving
- Styl3R: Instant 3D Stylized Reconstruction for Arbitrary Scenes and Styles
- The quest for the GRAph Level autoEncoder (GRALE)
- Towards Fully FP8 GEMM LLM Training at Scale