bandit feedback
- Bandit and Delayed Feedback in Online Structured Prediction
- Comparing Uniform Price and Discriminatory Multi-Unit Auctions through Regret Minimization
- From Average-Iterate to Last-Iterate Convergence in Games: A Reduction and Its Applications
- No-Regret Learning Under Adversarial Resource Constraints: A Spending Plan Is All You Need!
- Non-Uniform Multiclass Learning with Bandit Feedback
- Taming Adversarial Constraints in CMDPs
- Uncoupled and Convergent Learning in Monotone Games under Bandit Feedback
- Uniform Wrappers: Bridging Concave to Quadratizable Functions in Online Optimization