Crea vettori di frasi e caratteri successivi
Questo esercizio serve a mettere in evidenza l’importanza della preparazione dei dati. Userai testi con frasi del personaggio Sheldon della serie TV The Big Bang Theory come input e creerai i vettori degli indici delle frasi e dei caratteri successivi necessari prima di costruire un modello di generazione del testo.
Il testo è disponibile nella variabile sheldon, così come il vocabolario (i caratteri) nella variabile vocabulary, e gli iperparametri chars_window e step impostati rispettivamente a 20 e 3. Questo significa che una sequenza di 20 caratteri verrà usata per prevedere il carattere successivo e che la finestra si sposterà di 3 caratteri a ogni iterazione.
Inoltre, il pacchetto pandas come pd è già caricato nell’ambiente.
Questo esercizio fa parte del corso
Reti Neurali Ricorrenti (RNN) per il Language Modeling con Keras
Istruzioni dell'esercizio
- Dividi il testo per interruzione di riga per iterare sulle frasi.
- Itera fino alla fine della frase meno
chars_window. - Aggiungi alla variabile
sentencesla porzione di frase di lunghezzachars_windowe aggiungi alla variabilenext_charsil carattere successivo. - Usa i vettori ottenuti per creare un
pd.DataFrame()e stampa le sue prime righe.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
# Get 20 previous chars and next char; then shift by step
for i in range(0, len(sentence) - ____, step):
sentences.append(sentence[i:i + ____])
next_chars.append(sentence[____ + chars_window])
# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})
# Print the initial rows
print(df.head())