markov decision processes
Markov Decision Processes (MDPs) are mathematical frameworks used for modeling decision-making where outcomes are partly random and partly under the control of a decision-maker. They are foundational in reinforcement learning.
- Efficient Preference-Based Reinforcement Learning: Randomized Exploration meets Experimental Design
- Faster Fixed-Point Methods for Multichain MDPs
- Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
- Non-convex entropic mean-field optimization via Best Response flow
- Offline Actor-Critic for Average Reward MDPs
- Offline imitation learning in $Q^\pi$-realizable MDPs without expert realizability
- Planning and Learning in Average Risk-aware MDPs
- REINFORCE Converges to Optimal Policies with Any Learning Rate
- Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach
- Reinforcement Learning with Imperfect Transition Predictions: A Bellman-Jensen Approach
- Retrosynthesis Planning via Worst-path Policy Optimisation in Tree-structured MDPs
- Risk-Averse Total-Reward Reinforcement Learning
- SPOT: Scalable Policy Optimization with Trees for Markov Decision Processes
- Strategyproof Reinforcement Learning from Human Feedback
- Towards Large-Scale In-Context Reinforcement Learning by Meta-Training in Randomized Worlds