Tokenisera en textdatamängd
Du arbetar med marknadsundersökning för en reswebbplats och vill använda en befintlig datamängd för att finjustera en modell som klassificerar hotellrecensioner. Du väljer att använda biblioteket datasets.
Klassen AutoTokenizer har förimpорterats från transformers, och load_dataset() har förimporterats från datasets.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Lägg till utfyllnad (padding) i tokeniseraren för att bearbeta text i lika stora batchar.
- Tokenisera textdata med den förtränade GPT-tokeniseraren och den definierade funktionen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)