Mapowanie tokenizacji
Chcesz teraz przetestować większą kontrolę nad tokenizacją i spróbować tokenizować dane wierszami lub partiami. Dzięki temu otrzymasz obiekt DataSet, który będzie potrzebny do trenowania.
tokenizer został już wczytany wraz z danymi jako train_data i test_data.
To ćwiczenie jest częścią kursu
Wprowadzenie do LLM w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Complete the function
def tokenize_function(data):
return tokenizer(data["interaction"],
____,
padding=True,
____,
max_length=64)
tokenized_in_batches = ____