exploration-exploitation trade-off
A fundamental dilemma in reinforcement learning where the agent must choose between exploring unknown options to gather more information and exploiting known options that yield higher rewards.
- Constrained Feedback Learning for Non-Stationary Multi-Armed Bandits
- Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL
- Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
- Multimodal Bandits: Regret Lower Bounds and Optimal Algorithms
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- REINFORCE Converges to Optimal Policies with Any Learning Rate
- Scalable and Cost-Efficient de Novo Template-Based Molecular Generation
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- Sequential Monte Carlo for Policy Optimization in Continuous POMDPs