Mapování tokenizace
Teď si vyzkoušíš, jak mít větší kontrolu nad tokenizací, a zkusíš tokenizovat data po řádcích nebo dávkách. Výsledkem bude objekt DataSet, který budeš potřebovat pro trénování.
tokenizer je už načtený spolu s daty jako train_data a test_data.
Toto cvičení je součástí kurzu
Úvod do LLMs v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Complete the function
def tokenize_function(data):
return tokenizer(data["interaction"],
____,
padding=True,
____,
max_length=64)
tokenized_in_batches = ____