linear bandits
- Feel-Good Thompson Sampling for Contextual Bandits: a Markov Chain Monte Carlo Showdown
- Infrequent Exploration in Linear Bandits
- Instance-Dependent Regret Bounds for Nonstochastic Linear Partial Monitoring
- Provably Efficient Multi-Task Meta Bandit Learning via Shared Representations
- Scalable Exploration via Ensemble++