ÎncepețiÎncepe gratuit

Tokenizarea unui set de date text

Lucrezi la un studiu de piață pentru un site de turism și dorești să folosești un set de date existent pentru a ajusta fin un model care să clasifice recenzii de hoteluri. Decizi să folosești biblioteca datasets.

Clasa AutoTokenizer a fost pre-importată din transformers, iar load_dataset() a fost pre-importată din datasets.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Adaugă padding la tokenizator pentru a procesa textul în loturi de dimensiuni egale.
  • Tokenizează datele text folosind tokenizatorul GPT pre-antrenat și funcția definită.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Editează și rulează codul