НачатьНачать бесплатно

Токенизация текста

Вы хотите использовать предобученную модель из Hugging Face и дообучить её на данных команды поддержки вашей компании, чтобы классифицировать обращения по степени риска оттока клиентов. Это поможет команде расставлять приоритеты и действовать проактивно.

Подготовьте обучающие и тестовые данные для дообучения, выполнив токенизацию текста.

AutoTokenizer и AutoModelForSequenceClassification уже загружены для вас.

Это упражнение является частью курса

Введение в LLM на Python

Посмотреть курс

Инструкции к упражнению

  • Загрузите предобученную модель и токенизатор для подготовки к дообучению.
  • Токенизируйте данные train_data["interaction"] и test_data["interaction"], включив дополнение до одинаковой длины и усечение последовательностей.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")

# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)

print(tokenized_training_data)
Редактировать и запускать код