ПочатиПочніть безкоштовно

Попередня обробка даних

Ви вивчили відмінності в попередній обробці даних для багатокласової класифікації. Давайте застосуємо це на практиці, попередньо обробивши дані перед створенням простої моделі багатокласової класифікації.

Набір даних завантажено у змінну news_dataset і він має такі атрибути:

  • news_dataset.data: масив із текстами
  • news_dataset.target: масив із цільовими категоріями у вигляді числових індексів

У вибірці 5 000 спостережень.

Ця вправа є частиною курсу

Recurrent Neural Networks (RNNs) для моделювання мови з Keras

Переглянути курс

Інструкції до вправи

  • Створіть екземпляр класу Tokenizer у змінній tokenizer.
  • Навчіть tokenizer на текстових даних.
  • Використайте метод .texts_to_sequences() для текстових даних.
  • Застосуйте функцію to_categorical() для підготовки цільових індексів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Редагувати та запускати код