reward modeling
- Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
- Pre-Trained Policy Discriminators are General Reward Models
- Preference Distillation via Value based Reinforcement Learning
- Prompt Tuning Decision Transformers with Structured and Scalable Bandits
- Provably Efficient Online RLHF with One-Pass Reward Modeling