CommencezCommencez gratuitement

Préparer l'ensemble de données de préférences

Dans cet exercice, vous allez travailler avec un ensemble de données qui contient de la rétroaction humaine sous forme de sorties « chosen » et « rejected ». Votre tâche consiste à extraire les amorces (prompts) de la colonne « chosen » et à préparer les données pour l'entraînement d'un modèle de récompense.

La fonction load_dataset de datasets a été préimportée

Cette activité fait partie du cours

Reinforcement Learning from Human Feedback (RLHF)

Voir le cours

Instructions de l’exercice

  • Chargez l'ensemble de données trl-internal-testing/hh-rlhf-helpful-base-trl-style depuis Hugging Face.
  • Écrivez une fonction qui extrait l'amorce (prompt) du champ 'content', en supposant que l'amorce se trouve à l'indice 0 de l'entrée de la fonction.
  • Appliquez la fonction qui extrait l'amorce au sous-ensemble de données 'chosen'.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Modifier et exécuter le code