policy improvement
- Bootstrap Off-policy with World Model
- Learning Dynamics of RNNs in Closed-Loop Environments
- Retrosynthesis Planning via Worst-path Policy Optimisation in Tree-structured MDPs
- Value Improved Actor Critic Algorithms
- Value-Guided Decision Transformer: A Unified Reinforcement Learning Framework for Online and Offline Settings
- When Can Model-Free Reinforcement Learning be Enough for Thinking?