Kom igångKom igång gratis

Tokenisera en textdatamängd

Du arbetar med marknadsundersökning för en reswebbplats och vill använda en befintlig datamängd för att finjustera en modell som klassificerar hotellrecensioner. Du väljer att använda biblioteket datasets.

Klassen AutoTokenizer har förimpорterats från transformers, och load_dataset() har förimporterats från datasets.

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Lägg till utfyllnad (padding) i tokeniseraren för att bearbeta text i lika stora batchar.
  • Tokenisera textdata med den förtränade GPT-tokeniseraren och den definierade funktionen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Redigera och kör kod