Tokenizarea unui set de date text
Lucrezi la un studiu de piață pentru un site de turism și dorești să folosești un set de date existent pentru a ajusta fin un model care să clasifice recenzii de hoteluri. Decizi să folosești biblioteca datasets.
Clasa AutoTokenizer a fost pre-importată din transformers, iar load_dataset() a fost pre-importată din datasets.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Adaugă padding la tokenizator pentru a procesa textul în loturi de dimensiuni egale.
- Tokenizează datele text folosind tokenizatorul GPT pre-antrenat și funcția definită.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)