parallel training
- First Attentions Last: Better Exploiting First Attentions for Efficient Parallel Training
- Linear Attention for Efficient Bidirectional Sequence Modeling
- Multi-head Temporal Latent Attention
- Statistical Inference for Gradient Boosting Regression
- Train on Pins and Test on Obstacles for Rectilinear Steiner Minimum Tree