Tokeniser un ensemble de données textuelles
Vous faites de la recherche de marché pour un site de voyage et souhaitez utiliser un jeu de données existant pour peaufiner un modèle qui vous aidera à classifier des avis d'hôtels. Vous décidez d'utiliser la bibliothèque datasets.
La classe AutoTokenizer a été préimportée depuis transformers, et load_dataset() a été préimportée depuis datasets.
Cette activité fait partie du cours
Reinforcement Learning from Human Feedback (RLHF)
Instructions de l’exercice
- Ajoutez du remplissage au tokenizer pour traiter le texte en lots de taille égale.
- Tokenisez les données textuelles à l'aide du tokenizer GPT préentraîné et de la fonction définie.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)