Začněte nyníZačněte zdarma

Tokenizace textu

Chceš využít předtrénovaný model z Hugging Face a doladit ho pomocí dat od týmu zákaznické podpory ve tvé firmě, aby mohl klasifikovat interakce podle rizika odchodu zákazníků. To pomůže týmu lépe určit priority – co řešit jako první a jak k tomu přistoupit – a být tak více proaktivní.

Připrav trénovací a testovací data pro fine-tuning tokenizací textu.

AutoTokenizer a AutoModelForSequenceClassification jsou již načtené.

Toto cvičení je součástí kurzu

Úvod do LLMs v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Načti předtrénovaný model a tokenizér jako přípravu na fine-tuning.
  • Tokenizuj train_data["interaction"] i test_data["interaction"] a povol padding a zkracování sekvencí.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Upravit a spustit kód