Tokenizacja tekstu
Chcesz wykorzystać wstępnie wytrenowany model z Hugging Face i dostroić go na danych od zespołu wsparcia swojej firmy, aby klasyfikować interakcje według ryzyka rezygnacji klienta (churn). Pomoże to zespołowi ustalać priorytety i reagować proaktywnie.
Przygotuj dane treningowe i testowe do dostrajania modelu, tokenizując tekst.
Dane oraz klasy AutoTokenizer i AutoModelForSequenceClassification zostały już wczytane.
To ćwiczenie jest częścią kursu
Wprowadzenie do LLM w Pythonie
Instrukcje do ćwiczenia
- Wczytaj wstępnie wytrenowany model i tokenizator w celu przygotowania do dostrajania.
- Dokonaj tokenizacji zarówno
train_data["interaction"], jak itest_data["interaction"], włączając dopełnianie (padding) i obcinanie sekwencji (truncation).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)