optimal policy
In reinforcement learning, the strategy or action plan that maximizes the cumulative reward for an agent in an environment. Identifying the optimal policy is fundamental for effective decision-making in dynamic contexts.
- $Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
- Adaptive Frontier Exploration on Graphs with Applications to Network-Based Disease Testing
- Beyond Average Value Function in Precision Medicine: Maximum Probability-Driven Reinforcement Learning for Survival Analysis
- Convergence Theorems for Entropy-Regularized and Distributional Reinforcement Learning
- Deep learning for continuous-time stochastic control with jumps
- Direct Alignment with Heterogeneous Preferences
- Does Stochastic Gradient really succeed for bandits?
- Faster Fixed-Point Methods for Multichain MDPs
- GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
- Improved Regret and Contextual Linear Extension for Pandora's Box and Prophet Inequality
- Inference-time Alignment in Continuous Space
- Markov Persuasion Processes: Learning to Persuade From Scratch
- Preference Distillation via Value based Reinforcement Learning
- Protocols for Verifying Smooth Strategies in Bandits and Games
- Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
- Scalable Policy-Based RL Algorithms for POMDPs
- Strategyproof Reinforcement Learning from Human Feedback