Tokenizace textového datasetu
Pracuješ na průzkumu trhu pro cestovní web a chceš využít existující dataset k doladění modelu, který ti pomůže klasifikovat hotelové recenze. Rozhodneš se použít knihovnu datasets.
Třída AutoTokenizer je předem naimportována z transformers a funkce load_dataset() je předem naimportována z datasets.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Přidej do tokenizeru padding, aby bylo možné zpracovávat text v dávkách stejné velikosti.
- Tokenizuj textová data pomocí předtrénovaného GPT tokenizeru a definované funkce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
dataset = load_dataset("argilla/tripadvisor-hotel-reviews")
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Add padding with the pad token
tokenizer.____
def tokenize_function(examples):
return tokenizer(examples["text"], padding="max_length", truncation=True)
# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)