ПочатиПочніть безкоштовно

Токенізація тексту

Ви хочете скористатися попередньо натренованою моделлю з Hugging Face і донавчити її на даних команди підтримки вашої компанії, щоб класифікувати взаємодії залежно від ризику відтоку клієнта. Це допоможе команді визначати пріоритети: з чого почати й як діяти, щоб працювати більш проактивно.

Підготуйте тренувальні та тестові дані до донавчання, виконавши токенізацію тексту.

Об'єкти AutoTokenizer і AutoModelForSequenceClassification уже завантажено для вас.

Ця вправа є частиною курсу

Вступ до LLM у Python

Переглянути курс

Інструкції до вправи

  • Завантажте попередньо натреновані модель і токенайзер для підготовки до донавчання.
  • Виконайте токенізацію і для train_data["interaction"], і для test_data["interaction"], увімкнувши доповнення (padding) і урізання послідовностей (truncation).

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Редагувати та запускати код