CommencezCommencez gratuitement

Tokeniser un ensemble de données textuelles

Vous faites de la recherche de marché pour un site de voyage et souhaitez utiliser un jeu de données existant pour peaufiner un modèle qui vous aidera à classifier des avis d'hôtels. Vous décidez d'utiliser la bibliothèque datasets.

La classe AutoTokenizer a été préimportée depuis transformers, et load_dataset() a été préimportée depuis datasets.

Cette activité fait partie du cours

Reinforcement Learning from Human Feedback (RLHF)

Voir le cours

Instructions de l’exercice

  • Ajoutez du remplissage au tokenizer pour traiter le texte en lots de taille égale.
  • Tokenisez les données textuelles à l'aide du tokenizer GPT préentraîné et de la fonction définie.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Modifier et exécuter le code