Začněte nyníZačněte zdarma

Tokenizace textového datasetu

Pracuješ na průzkumu trhu pro cestovní web a chceš využít existující dataset k doladění modelu, který ti pomůže klasifikovat hotelové recenze. Rozhodneš se použít knihovnu datasets.

Třída AutoTokenizer je předem naimportována z transformers a funkce load_dataset() je předem naimportována z datasets.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Přidej do tokenizeru padding, aby bylo možné zpracovávat text v dávkách stejné velikosti.
  • Tokenizuj textová data pomocí předtrénovaného GPT tokenizeru a definované funkce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
Upravit a spustit kód