Reward Modeling
concepts · 1 notes linked
Related: Stanford University · Deepmind · Reinforcement Learning · Large Language Models · AI Alignment
Notes
- Researchers From Stanford And DeepMind Come Up With The Idea of Using Large Language Models LLMs as a Proxy Reward Function — LLMs as proxy reward functions for RL agent alignment via natural language