Tokenizarea textului
Vrei să folosești un model pre-antrenat de pe Hugging Face și să îl ajustezi (fine-tuning) cu date de la echipa de suport a companiei, pentru a clasifica interacțiunile în funcție de riscul de churn. Astfel, echipa poate prioritiza mai ușor ce trebuie abordat și cum, adoptând o atitudine mai proactivă.
Pregătește datele de antrenament și de testare pentru fine-tuning prin tokenizarea textului.
AutoTokenizer și AutoModelForSequenceClassification au fost deja importate pentru tine.
Acest exercițiu face parte din cursul
Introducere în LLM-uri cu Python
Instrucțiuni pentru exercițiu
- Încarcă modelul pre-antrenat și tokenizer-ul în vederea ajustării (fine-tuning).
- Tokenizează atât
train_data["interaction"], cât șitest_data["interaction"], activând padding-ul și trunchierea secvențelor.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)