online mirror descent
An optimization algorithm that generalizes traditional mirror descent techniques for settings where data arrives sequentially, allowing for efficient updates to model parameters.
- Efficient Last-Iterate Convergence in Solving Extensive-Form Games
- Generalized Linear Bandits: Almost Optimal Regret with One-Pass Update
- Last-Iterate Convergence of Smooth Regret Matching$^+$ Variants in Learning Nash Equilibria
- On the Universal Near Optimality of Hedge in Combinatorial Settings
- Provably Efficient Online RLHF with One-Pass Reward Modeling
- Stochastic Shortest Path with Sparse Adversarial Costs
- True Impact of Cascade Length in Contextual Cascading Bandits