training efficiency
The effectiveness with which a model learns from data considering the time, resource usage, and training iterations involved.
- A High-Dimensional Statistical Method for Optimizing Transfer Quantities in Multi-Source Transfer Learning
- A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone
- Accelerating Block Coordinate Descent for LLM Finetuning via Landscape Expansion
- AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
- Adaptive Discretization for Consistency Models
- Attribution-Driven Adaptive Token Pruning for Transformers
- Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
- BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- Boosting Generative Image Modeling via Joint Image-Feature Synthesis
- CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- Conditioning Matters: Training Diffusion Policies is Faster Than You Think
- Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
- DataRater: Meta-Learned Dataset Curation
- Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention
- Discrete Neural Flow Samplers with Locally Equivariant Transformer
- DuetGraph: Coarse-to-Fine Knowledge Graph Reasoning with Dual-Pathway Global-Local Fusion
- Efficient Representativeness-Aware Coreset Selection
- Efficient Speech Language Modeling via Energy Distance in Continuous Latent Space
- Error Feedback under $(L_0,L_1)$-Smoothness: Normalization and Momentum
- FlowMoE: A Scalable Pipeline Scheduling Framework for Distributed Mixture-of-Experts Training
- GSRF: Complex-Valued 3D Gaussian Splatting for Efficient Radio-Frequency Data Synthesis
- Generative Pre-trained Autoregressive Diffusion Transformer
- How Many Tokens Do 3D Point Cloud Transformer Architectures Really Need?
- LILO: Learning to Reason at the Frontier of Learnability
- Linear Attention for Efficient Bidirectional Sequence Modeling
- NTKMTL: Mitigating Task Imbalance in Multi-Task Learning from Neural Tangent Kernel Perspective
- NeuralPLexer3: Accurate Biomolecular Complex Structure Prediction with Flow Models
- PubSub-VFL: Towards Efficient Two-Party Split Learning in Heterogeneous Environments via Publisher/Subscriber Architecture
- Quantum Visual Fields with Neural Amplitude Encoding
- RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
- RULE: Reinforcement UnLEarning Achieves Forget-retain Pareto Optimality
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
- Robust and Scalable Autonomous Reinforcement Learning in Irreversible Environments
- Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
- Skrull: Towards Efficient Long Context Fine-tuning through Dynamic Data Scheduling
- SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
- T-SHIRT: Token-Selective Hierarchical Data Selection for Instruction Tuning
- Transferring Linear Features Across Language Models With Model Stitching
- URLs Help, Topics Guide: Understanding Metadata Utility in LLM Training
- Unveiling the Power of Multiple Gossip Steps: A Stability-Based Generalization Analysis in Decentralized Training
- Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
- Vulnerable Data-Aware Adversarial Training
- When Does Curriculum Learning Help? A Theoretical Perspective
- ZeCO: Zero-Communication Overhead Sequence Parallelism for Linear Attention