Atténuer une divergence KL négative
Vous avez peaufiné le modèle à l'aide de techniques RLHF et vous avez constaté que ses performances se sont dégradées par rapport au modèle de base. Vous soupçonnez une divergence KL négative et vous souhaitez donc définir les bons paramètres de génération pour éviter ce problème.
Le tokenizer a déjà été importé.
Cette activité fait partie du cours
Reinforcement Learning from Human Feedback (RLHF)
Instructions de l’exercice
- Définissez
top_ketmin_lengthà des valeurs qui aident à éviter la divergence KL.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}