Začněte nyníZačněte zdarma

Mapování tokenizace

Teď si vyzkoušíš, jak mít větší kontrolu nad tokenizací, a zkusíš tokenizovat data po řádcích nebo dávkách. Výsledkem bude objekt DataSet, který budeš potřebovat pro trénování.

tokenizer je už načtený spolu s daty jako train_data a test_data.

Toto cvičení je součástí kurzu

Úvod do LLMs v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Complete the function
def tokenize_function(data):
    return tokenizer(data["interaction"], 
                     ____, 
                     padding=True, 
                     ____, 
                     max_length=64)

tokenized_in_batches = ____
Upravit a spustit kód