Reinforcement Learning From Human Feedback

concepts · 4 notes linked

Related: Anthropic · AI Safety · Openai · Chatgpt · AI Alignment · Deepmind · Paul Christiano · Large Language Models

Notes