IA
RLHF
Reinforcement Learning from Human Feedback
Le RLHF est une méthode d’entraînement par renforcement qui s’appuie sur des retours humains. Des personnes notent et comparent les réponses du modèle, et ces préférences servent à ajuster son comportement pour l’aligner sur ce qu’on attend de lui.
C’est l’étape qui transforme un modèle brut, capable de prédire du texte, en assistant qui répond de façon utile, honnête et moins risquée. Elle intervient généralement après le pré-entraînement et le fine-tuning, dans le travail d’alignement.