RLHF: Aligning AI Behavior

Reinforcement Learning from Human Feedback (RLHF) is a machine learning technique that uses human judgments as reward signals to align AI models, particularly LLMs, more closely with human values and preferences.

Sources

Open the full topic