reward engineering
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning