Taiji Suzuki
- Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency
- From Shortcut to Induction Head: How Data Diversity Shapes Algorithm Selection in Transformers
- Generalization Bound of Gradient Flow through Training Trajectory and Data-dependent Kernel
- Hessian-guided Perturbed Wasserstein Gradient Flows for Escaping Saddle Points
- How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime?
- State Size Independent Statistical Error Bound for Discrete Diffusion Models
- Trained Mamba Emulates Online Gradient Descent in In-Context Linear Regression