Токенизация текста
Вы хотите использовать предобученную модель из Hugging Face и дообучить её на данных команды поддержки вашей компании, чтобы классифицировать обращения по степени риска оттока клиентов. Это поможет команде расставлять приоритеты и действовать проактивно.
Подготовьте обучающие и тестовые данные для дообучения, выполнив токенизацию текста.
AutoTokenizer и AutoModelForSequenceClassification уже загружены для вас.
Это упражнение является частью курса
Введение в LLM на Python
Инструкции к упражнению
- Загрузите предобученную модель и токенизатор для подготовки к дообучению.
- Токенизируйте данные
train_data["interaction"]иtest_data["interaction"], включив дополнение до одинаковой длины и усечение последовательностей.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the model and tokenizer
model = ____.____("distilbert-base-uncased")
tokenizer = ____.____("distilbert-base-uncased")
# Tokenize the data
tokenized_training_data = ____(train_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
tokenized_test_data = ____(test_data["interaction"], return_tensors="pt", ____, ____, max_length=20)
print(tokenized_training_data)