thompson sampling
Thompson sampling is a Bayesian approach to sequential decision-making and reinforcement learning that balances exploration and exploitation by selecting actions according to their probability of being optimal based on current knowledge.
- Adaptive Variance Inflation in Thompson Sampling: Efficiency, Safety, Robustness, and Beyond
- Contextual Thompson Sampling via Generation of Missing Data
- Exploring and Exploiting Model Uncertainty in Bayesian Optimization
- Feel-Good Thompson Sampling for Contextual Bandits: a Markov Chain Monte Carlo Showdown
- Infrequent Exploration in Linear Bandits
- LaRes: Evolutionary Reinforcement Learning with LLM-based Adaptive Reward Search
- Martingale Posterior Neural Networks for Fast Sequential Decision Making
- No-Regret Thompson Sampling for Finite-Horizon Markov Decision Processes with Gaussian Processes
- Scalable Exploration via Ensemble++
- Steering Generative Models with Experimental Data for Protein Fitness Optimization
- Thompson Sampling for Multi-Objective Linear Contextual Bandit
- Thompson Sampling in Function Spaces via Neural Operators
- Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits