Thalaiyasingam Ajanthan
- Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training
- Sharper Convergence Rates for Nonconvex Optimisation via Reduction Mappings
- Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism
- Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization