Zacznij terazZacznij za darmo

Tokenizacja tekstu

Chcesz wykorzystać wstępnie wytrenowany model z Hugging Face i dostroić go na danych od zespołu wsparcia swojej firmy, aby klasyfikować interakcje według ryzyka rezygnacji klienta (churn). Pomoże to zespołowi ustalać priorytety i reagować proaktywnie.

Przygotuj dane treningowe i testowe do dostrajania modelu, tokenizując tekst.

Dane oraz klasy AutoTokenizer i AutoModelForSequenceClassification zostały już wczytane.

To ćwiczenie jest częścią kursu

Wprowadzenie do LLM w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj wstępnie wytrenowany model i tokenizator w celu przygotowania do dostrajania.
  • Dokonaj tokenizacji zarówno train_data["interaction"], jak i test_data["interaction"], włączając dopełnianie (padding) i obcinanie sekwencji (truncation).

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Edytuj i uruchom kod