reinforcement learning algorithms
- A Finite Sample Analysis of Distributional TD Learning with Linear Function Approximation
- Beyond Average Value Function in Precision Medicine: Maximum Probability-Driven Reinforcement Learning for Survival Analysis
- Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL