Kom igångKom igång gratis

Tokenisera text

Du vill använda en förtränad modell från Hugging Face och finjustera den med data från ditt företags supportteam för att klassificera interaktioner utifrån risken för kundbortfall. Det hjälper teamet att prioritera vad som behöver hanteras först, och hur – vilket gör dem mer proaktiva.

Förbered tränings- och testdata för finjustering genom att tokenisera texten.

AutoTokenizer och AutoModelForSequenceClassification har redan lästs in åt dig.

Den här övningen är en del av kursen

Introduktion till LLM:er i Python

Visa kurs

Övningsinstruktioner

  • Läs in den förtränade modellen och tokeniseraren som förberedelse för finjustering.
  • Tokenisera både train_data["interaction"] och test_data["interaction"], och aktivera utfyllnad (padding) och sekvenstrunkering.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Redigera och kör kod