Inizia subitoInizia gratis

Previsione di testo con le LSTM

Nei prossimi esercizi costruirai un piccolo modello LSTM in grado di prevedere la parola successiva usando un piccolo insieme di dati testuali. Questo insieme contiene citazioni ripulite dai film The Lord of the Ring. Le trovi nella variabile text.

Trasformerai questo text in sequences di lunghezza 4 e userai il Tokenizer di Keras per preparare le caratteristiche (feature) e le etichette per il tuo modello!

Il Tokenizer di Keras è già importato e pronto all'uso. Assegna un numero univoco a ogni parola univoca e memorizza le associazioni in un dizionario. Questo è importante perché il modello lavora con numeri, ma poi vorremo decodificare i numeri di output di nuovo in parole.

Questo esercizio fa parte del corso

Introduzione al Deep Learning con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Dividi il testo in un array di parole usando .split().
  • Crea frasi da 4 parole ciascuna, spostandoti di una parola alla volta.
  • Istanzia un Tokenizer(), poi adattalo alle frasi con .fit_on_texts().
  • Trasforma sentences in una sequenza di numeri chiamando .texts_to_sequences().

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Split text into an array of words 
words = ____.____

# Make sentences of 4 words each, moving one word at a time
sentences = []
for i in range(4, len(words)):
  sentences.append(' '.join(words[i-____:i]))

# Instantiate a Tokenizer, then fit it on the sentences
tokenizer = ____
tokenizer.____(____)

# Turn sentences into a sequence of numbers
sequences = tokenizer.____(____)
print("Sentences: \n {} \n Sequences: \n {}".format(sentences[:5],sequences[:5]))
Modifica ed esegui il codice