Zacznij terazZacznij za darmo

Tokenizacja zbioru danych tekstowych

Pracujesz nad badaniem rynku dla serwisu turystycznego i chcesz wykorzystać istniejący zbiór danych do dostrojenia modelu klasyfikującego recenzje hoteli. W tym celu używasz biblioteki datasets.

Klasa AutoTokenizer została wcześniej zaimportowana z transformers, a funkcja load_dataset() – z datasets.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Dodaj dopełnienie (padding) do tokenizatora, aby przetwarzać tekst w partiach o jednakowym rozmiarze.
  • Stokenizuj dane tekstowe, używając wstępnie wytrenowanego tokenizatora GPT i zdefiniowanej funkcji.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Edytuj i uruchom kod