training performance
- Certifying Deep Network Risks and Individual Predictions with PAC-Bayes Loss via Localized Priors
- Dense Backpropagation Improves Training for Sparse Mixture-of-Experts
- Efficient Pre-Training of LLMs via Topology-Aware Communication Alignment on More Than 9600 GPUs
- Efficient Training of Minimal and Maximal Low-Rank Recurrent Neural Networks
- HybridNorm: Towards Stable and Efficient Transformer Training via Hybrid Normalization