Inizia subitoInizia gratis

Crea vettori di frasi e caratteri successivi

Questo esercizio serve a mettere in evidenza l’importanza della preparazione dei dati. Userai testi con frasi del personaggio Sheldon della serie TV The Big Bang Theory come input e creerai i vettori degli indici delle frasi e dei caratteri successivi necessari prima di costruire un modello di generazione del testo.

Il testo è disponibile nella variabile sheldon, così come il vocabolario (i caratteri) nella variabile vocabulary, e gli iperparametri chars_window e step impostati rispettivamente a 20 e 3. Questo significa che una sequenza di 20 caratteri verrà usata per prevedere il carattere successivo e che la finestra si sposterà di 3 caratteri a ogni iterazione.

Inoltre, il pacchetto pandas come pd è già caricato nell’ambiente.

Questo esercizio fa parte del corso

Reti Neurali Ricorrenti (RNN) per il Language Modeling con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Dividi il testo per interruzione di riga per iterare sulle frasi.
  • Itera fino alla fine della frase meno chars_window.
  • Aggiungi alla variabile sentences la porzione di frase di lunghezza chars_window e aggiungi alla variabile next_chars il carattere successivo.
  • Usa i vettori ottenuti per creare un pd.DataFrame() e stampa le sue prime righe.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
    # Get 20 previous chars and next char; then shift by step
    for i in range(0, len(sentence) - ____, step):
        sentences.append(sentence[i:i + ____])
        next_chars.append(sentence[____ + chars_window])

# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})

# Print the initial rows
print(df.head())
Modifica ed esegui il codice