Zacznij terazZacznij za darmo

Przetwarzanie danych

Poznałeś różnice w przetwarzaniu danych w przypadku klasyfikacji wieloklasowej. Czas zastosować tę wiedzę w praktyce – przygotuj dane do stworzenia prostego modelu klasyfikacji wieloklasowej.

Zbiór danych jest załadowany do zmiennej news_dataset i ma następujące atrybuty:

  • news_dataset.data: tablica z tekstami
  • news_dataset.target: tablica z docelowymi kategoriami jako indeksami numerycznymi

Próbka danych zawiera 5 000 obserwacji.

To ćwiczenie jest częścią kursu

Rekurencyjne sieci neuronowe (RNN) do modelowania języka w Keras

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz instancję klasy Tokenizer i przypisz ją do zmiennej tokenizer.
  • Dopasuj zmienną tokenizer do danych tekstowych.
  • Użyj metody .texts_to_sequences() na danych tekstowych.
  • Użyj funkcji to_categorical(), aby przygotować indeksy docelowe.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Edytuj i uruchom kod