Tokenizace textu
Chceš využít předtrénovaný model z Hugging Face a doladit ho pomocí dat od týmu zákaznické podpory ve tvé firmě, aby mohl klasifikovat interakce podle rizika odchodu zákazníků. To pomůže týmu lépe určit priority – co řešit jako první a jak k tomu přistoupit – a být tak více proaktivní.
Připrav trénovací a testovací data pro fine-tuning tokenizací textu.
AutoTokenizer a AutoModelForSequenceClassification jsou již načtené.
Toto cvičení je součástí kurzu
Úvod do LLMs v Pythonu
Pokyny k cvičení
- Načti předtrénovaný model a tokenizér jako přípravu na fine-tuning.
- Tokenizuj
train_data["interaction"]itest_data["interaction"]a povol padding a zkracování sekvencí.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)