Pre-elabora i dati
Hai imparato le differenze nel pre-processing dei dati per il caso di classificazione multi-classe. Mettiamolo in pratica pre-elaborando i dati in vista della creazione di un semplice modello di classificazione multi-classe.
Il dataset è caricato nella variabile news_dataset e ha i seguenti attributi:
news_dataset.data: array con i testinews_dataset.target: array con le categorie target come indici numerici
I dati di esempio contengono 5.000 osservazioni.
Questo esercizio fa parte del corso
Reti Neurali Ricorrenti (RNN) per il Language Modeling con Keras
Istruzioni dell'esercizio
- Istanzia la classe
Tokenizernella variabiletokenizer. - Esegui il fit della variabile
tokenizersui dati testuali. - Usa il metodo
.texts_to_sequences()sui dati testuali. - Usa la funzione
to_categorical()per preparare gli indici target.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)