CommencezCommencez gratuitement

Atténuer une divergence KL négative

Vous avez peaufiné le modèle à l'aide de techniques RLHF et vous avez constaté que ses performances se sont dégradées par rapport au modèle de base. Vous soupçonnez une divergence KL négative et vous souhaitez donc définir les bons paramètres de génération pour éviter ce problème.

Le tokenizer a déjà été importé.

Cette activité fait partie du cours

Reinforcement Learning from Human Feedback (RLHF)

Voir le cours

Instructions de l’exercice

  • Définissez top_k et min_length à des valeurs qui aident à éviter la divergence KL.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
Modifier et exécuter le code