training loss
- IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation
- Learning Dynamics of RNNs in Closed-Loop Environments
- Low Rank Gradients and Where to Find Them
- Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
- Temperature is All You Need for Generalization in Langevin Dynamics and other Markov Processes