Začněte nyníZačněte zdarma

Předzpracování dat

Naučil/a ses, v čem se liší předzpracování dat pro případ multi-class klasifikace. Teď to vyzkoušíme v praxi – předzpracujeme data, abychom mohli sestavit jednoduchý model pro multi-class klasifikaci.

Dataset je načtený v proměnné news_dataset a má tyto atributy:

  • news_dataset.data: pole s texty
  • news_dataset.target: pole s cílovými kategoriemi jako číselné indexy

Vzorová data obsahují 5 000 pozorování.

Toto cvičení je součástí kurzu

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci třídy Tokenizer a ulož ji do proměnné tokenizer.
  • Natrénuj proměnnou tokenizer na textových datech.
  • Použij metodu .texts_to_sequences() na textová data.
  • Pomocí funkce to_categorical() připrav cílové indexy.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Upravit a spustit kód