Inizia subitoInizia gratis

Pre-elabora i dati

Hai imparato le differenze nel pre-processing dei dati per il caso di classificazione multi-classe. Mettiamolo in pratica pre-elaborando i dati in vista della creazione di un semplice modello di classificazione multi-classe.

Il dataset è caricato nella variabile news_dataset e ha i seguenti attributi:

  • news_dataset.data: array con i testi
  • news_dataset.target: array con le categorie target come indici numerici

I dati di esempio contengono 5.000 osservazioni.

Questo esercizio fa parte del corso

Reti Neurali Ricorrenti (RNN) per il Language Modeling con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Istanzia la classe Tokenizer nella variabile tokenizer.
  • Esegui il fit della variabile tokenizer sui dati testuali.
  • Usa il metodo .texts_to_sequences() sui dati testuali.
  • Usa la funzione to_categorical() per preparare gli indici target.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Modifica ed esegui il codice