optimal policies
Strategies in decision-making frameworks, especially in reinforcement learning, that yield the best expected outcome over time, guiding agents on how to behave in various states to maximize cumulative rewards.
- Beyond Scalar Rewards: An Axiomatic Framework for Lexicographic MDPs
- Efficient Safe Meta-Reinforcement Learning: Provable Near-Optimality and Anytime Safety
- FANS: A Flatness-Aware Network Structure for Generalization in Offline Reinforcement Learning
- Learning and Planning Multi-Agent Tasks via an MoE-based World Model
- Multi-Environment POMDPs: Discrete Model Uncertainty Under Partial Observability
- Near-Optimal Regret-Queue Length Tradeoff in Online Learning for Two-Sided Markets
- Regret Lower Bounds for Decentralized Multi-Agent Stochastic Shortest Path Problems