Tokenisera text
Du vill använda en förtränad modell från Hugging Face och finjustera den med data från ditt företags supportteam för att klassificera interaktioner utifrån risken för kundbortfall. Det hjälper teamet att prioritera vad som behöver hanteras först, och hur – vilket gör dem mer proaktiva.
Förbered tränings- och testdata för finjustering genom att tokenisera texten.
AutoTokenizer och AutoModelForSequenceClassification har redan lästs in åt dig.
Den här övningen är en del av kursen
Introduktion till LLM:er i Python
Övningsinstruktioner
- Läs in den förtränade modellen och tokeniseraren som förberedelse för finjustering.
- Tokenisera både
train_data["interaction"]ochtest_data["interaction"], och aktivera utfyllnad (padding) och sekvenstrunkering.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)