experience replay
- Compact Memory for Continual Logistic Regression
- Conformal Prediction Beyond the Horizon: Distribution-Free Inference for Policy Evaluation
- Gradient-Guided Epsilon Constraint Method for Online Continual Learning
- Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
- Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training