Przetwarzanie danych
Poznałeś różnice w przetwarzaniu danych w przypadku klasyfikacji wieloklasowej. Czas zastosować tę wiedzę w praktyce – przygotuj dane do stworzenia prostego modelu klasyfikacji wieloklasowej.
Zbiór danych jest załadowany do zmiennej news_dataset i ma następujące atrybuty:
news_dataset.data: tablica z tekstaminews_dataset.target: tablica z docelowymi kategoriami jako indeksami numerycznymi
Próbka danych zawiera 5 000 obserwacji.
To ćwiczenie jest częścią kursu
Rekurencyjne sieci neuronowe (RNN) do modelowania języka w Keras
Instrukcje do ćwiczenia
- Utwórz instancję klasy
Tokenizeri przypisz ją do zmiennejtokenizer. - Dopasuj zmienną
tokenizerdo danych tekstowych. - Użyj metody
.texts_to_sequences()na danych tekstowych. - Użyj funkcji
to_categorical(), aby przygotować indeksy docelowe.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)