The Capacity for Moral Self-Correction in Large Language Models

rlhfmoral-self-correctionai-alignmentai-safetyanthropicllm-scaling

Abstraction: RLHF-trained LLMs can self-correct harmful outputs when instructed

Key points:

Connections: Anthropic · Reinforcement Learning From Human Feedback · AI Safety · Large Language Models · AI Alignment

Source: https://arxiv.org/abs/2302.07459