Предобработка данных
Вы узнали об особенностях предобработки данных для задачи многоклассовой классификации. Теперь применим эти знания на практике и подготовим данные для создания простой модели многоклассовой классификации.
Набор данных загружен в переменную news_dataset и содержит следующие атрибуты:
news_dataset.data: массив с текстамиnews_dataset.target: массив с целевыми категориями в виде числовых индексов
Выборка содержит 5 000 наблюдений.
Это упражнение является частью курса
Рекуррентные нейронные сети (RNN) для языкового моделирования с Keras
Инструкции к упражнению
- Создайте экземпляр класса
Tokenizerи сохраните его в переменнуюtokenizer. - Обучите
tokenizerна текстовых данных. - Примените метод
.texts_to_sequences()к текстовым данным. - Используйте функцию
to_categorical()для подготовки целевых индексов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)