temporal difference learning
- A General-Purpose Theorem for High-Probability Bounds of Stochastic Approximation with Polyak Averaging
- A Unifying View of Linear Function Approximation in Off-Policy RL Through Matrix Splitting and Preconditioning
- STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
- Towards Provable Emergence of In-Context Reinforcement Learning