Попередня обробка даних
Ви вивчили відмінності в попередній обробці даних для багатокласової класифікації. Давайте застосуємо це на практиці, попередньо обробивши дані перед створенням простої моделі багатокласової класифікації.
Набір даних завантажено у змінну news_dataset і він має такі атрибути:
news_dataset.data: масив із текстамиnews_dataset.target: масив із цільовими категоріями у вигляді числових індексів
У вибірці 5 000 спостережень.
Ця вправа є частиною курсу
Recurrent Neural Networks (RNNs) для моделювання мови з Keras
Інструкції до вправи
- Створіть екземпляр класу
Tokenizerу зміннійtokenizer. - Навчіть
tokenizerна текстових даних. - Використайте метод
.texts_to_sequences()для текстових даних. - Застосуйте функцію
to_categorical()для підготовки цільових індексів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)