Researchers From Stanford And DeepMind Come Up With The Idea of Using Large Language Models LLMs as a Proxy Reward Function

llmreinforcement-learningreward-modelingrlhfalignment

Abstraction: LLMs as proxy reward functions for RL agent alignment via natural language

Key points:

Connections: Stanford University · Deepmind · Reinforcement Learning · Large Language Models · Reward Modeling

Source: https://www.marktechpost.com/2023/07/20/researchers-from-stanford-and-deepmind-come-up-with-the-idea-of-using-large-language-models-llms-as-a-proxy-reward-function/