training stability
The consistency and reliability of a model's training process, characterized by predictable convergence and minimal fluctuations in loss or accuracy.
- A Gradient Guidance Perspective on Stepwise Preference Optimization for Diffusion Models
- Actor-Free Continuous Control via Structurally Maximizable Q-Functions
- Adaptive Gradient Masking for Balancing ID and MLLM-based Representations in Recommendation
- AmorLIP: Efficient Language-Image Pretraining via Amortization
- Block-Biased Mamba for Long-Range Sequence Processing
- Bootstrap Off-policy with World Model
- Curriculum Abductive Learning
- Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
- Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
- Hyperbolic Dataset Distillation
- Learning to Integrate Diffusion ODEs by Averaging the Derivatives
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
- Quantum Doubly Stochastic Transformers
- Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback
- ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
- Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
- Revisiting Residual Connections: Orthogonal Updates for Stable and Efficient Deep Networks
- Sinusoidal Initialization, Time for a New Start
- UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
- Variational Regularized Unbalanced Optimal Transport: Single Network, Least Action