exploration
The process of searching through the action space in reinforcement learning to discover new and potentially beneficial actions. This balances the trade-off between exploring unexplored actions and exploiting known high-value actions to maximize cumulative rewards.
- 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities
- 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities
- Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
- EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
- ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
- Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
- Intrinsic Benefits of Categorical Distributional Loss: Uncertainty-aware Regularized Exploration in Reinforcement Learning
- Large Language Models Think Too Fast To Explore Effectively
- Learning to Reason under Off-Policy Guidance
- NAVIX: Scaling MiniGrid Environments with JAX
- Novel Exploration via Orthogonality
- Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- Preference Learning with Lie Detectors can Induce Honesty or Evasion
- ProSpero: Active Learning for Robust Protein Design Beyond Wild-Type Neighborhoods
- ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
- Reinforcement Learning with Action Chunking
- Reward-Aware Proto-Representations in Reinforcement Learning
- Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction