markov decision process
A Markov Decision Process (MDP) is a mathematical framework used to describe an environment in reinforcement learning, defined by states, actions, transition probabilities, and rewards, enabling the formulation of both policy and value functions for decision making.
- A Finite Sample Analysis of Distributional TD Learning with Linear Function Approximation
- A Generalized Bisimulation Metric of State Similarity between Markov Decision Processes: From Theoretical Propositions to Applications
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- Beyond Scalar Rewards: An Axiomatic Framework for Lexicographic MDPs
- Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs
- HYPRL: Reinforcement Learning of Control Policies for Hyperproperties
- Multi-agent Markov Entanglement
- Multi-step Visual Reasoning with Visual Tokens Scaling and Verification
- Optimizing the Unknown: Black Box Bayesian Optimization with Energy-Based Model and Reinforcement Learning
- Reinforced Active Learning for Large-Scale Virtual Screening with Learnable Policy Model
- Sample Complexity of Distributionally Robust Average-Reward Reinforcement Learning
- Test-Time Scaling of Diffusion Models via Noise Trajectory Search