Токенізація тексту
Ви хочете скористатися попередньо натренованою моделлю з Hugging Face і донавчити її на даних команди підтримки вашої компанії, щоб класифікувати взаємодії залежно від ризику відтоку клієнта. Це допоможе команді визначати пріоритети: з чого почати й як діяти, щоб працювати більш проактивно.
Підготуйте тренувальні та тестові дані до донавчання, виконавши токенізацію тексту.
Об'єкти AutoTokenizer і AutoModelForSequenceClassification уже завантажено для вас.
Ця вправа є частиною курсу
Вступ до LLM у Python
Інструкції до вправи
- Завантажте попередньо натреновані модель і токенайзер для підготовки до донавчання.
- Виконайте токенізацію і для
train_data["interaction"], і дляtest_data["interaction"], увімкнувши доповнення (padding) і урізання послідовностей (truncation).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)