Zacznij terazZacznij za darmo

Mapowanie tokenizacji

Chcesz teraz przetestować większą kontrolę nad tokenizacją i spróbować tokenizować dane wierszami lub partiami. Dzięki temu otrzymasz obiekt DataSet, który będzie potrzebny do trenowania.

tokenizer został już wczytany wraz z danymi jako train_data i test_data.

To ćwiczenie jest częścią kursu

Wprowadzenie do LLM w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Complete the function
def tokenize_function(data):
    return tokenizer(data["interaction"], 
                     ____, 
                     padding=True, 
                     ____, 
                     max_length=64)

tokenized_in_batches = ____
Edytuj i uruchom kod