ÎncepețiÎncepe gratuit

Tokenizarea textului

Vrei să folosești un model pre-antrenat de pe Hugging Face și să îl ajustezi (fine-tuning) cu date de la echipa de suport a companiei, pentru a clasifica interacțiunile în funcție de riscul de churn. Astfel, echipa poate prioritiza mai ușor ce trebuie abordat și cum, adoptând o atitudine mai proactivă.

Pregătește datele de antrenament și de testare pentru fine-tuning prin tokenizarea textului.

AutoTokenizer și AutoModelForSequenceClassification au fost deja importate pentru tine.

Acest exercițiu face parte din cursul

Introducere în LLM-uri cu Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă modelul pre-antrenat și tokenizer-ul în vederea ajustării (fine-tuning).
  • Tokenizează atât train_data["interaction"], cât și test_data["interaction"], activând padding-ul și trunchierea secvențelor.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Editează și rulează codul