Předzpracování dat
Naučil/a ses, v čem se liší předzpracování dat pro případ multi-class klasifikace. Teď to vyzkoušíme v praxi – předzpracujeme data, abychom mohli sestavit jednoduchý model pro multi-class klasifikaci.
Dataset je načtený v proměnné news_dataset a má tyto atributy:
news_dataset.data: pole s textynews_dataset.target: pole s cílovými kategoriemi jako číselné indexy
Vzorová data obsahují 5 000 pozorování.
Toto cvičení je součástí kurzu
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras
Pokyny k cvičení
- Vytvoř instanci třídy
Tokenizera ulož ji do proměnnétokenizer. - Natrénuj proměnnou
tokenizerna textových datech. - Použij metodu
.texts_to_sequences()na textová data. - Pomocí funkce
to_categorical()připrav cílové indexy.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)