НачатьНачать бесплатно

Предобработка данных

Вы узнали об особенностях предобработки данных для задачи многоклассовой классификации. Теперь применим эти знания на практике и подготовим данные для создания простой модели многоклассовой классификации.

Набор данных загружен в переменную news_dataset и содержит следующие атрибуты:

  • news_dataset.data: массив с текстами
  • news_dataset.target: массив с целевыми категориями в виде числовых индексов

Выборка содержит 5 000 наблюдений.

Это упражнение является частью курса

Рекуррентные нейронные сети (RNN) для языкового моделирования с Keras

Посмотреть курс

Инструкции к упражнению

  • Создайте экземпляр класса Tokenizer и сохраните его в переменную tokenizer.
  • Обучите tokenizer на текстовых данных.
  • Примените метод .texts_to_sequences() к текстовым данным.
  • Используйте функцию to_categorical() для подготовки целевых индексов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Редактировать и запускать код