Creează vectori de propoziții și caractere următoare
Acest exercițiu urmărește să sublinieze importanța pregătirii datelor. Vei folosi texte cu fraze ale personajului Sheldon din serialul The Big Bang Theory ca date de intrare și vei crea vectori de indecși de propoziții și caractere următoare, necesari înainte de a construi un model de generare de text.
Textul este disponibil în variabila sheldon, vocabularul (caracterele) se află în variabila vocabulary, iar hiperparametrii chars_window și step sunt definiți cu valorile 20 și, respectiv, 3. Aceasta înseamnă că o secvență de 20 de caractere va fi folosită pentru a prezice caracterul următor, iar fereastra se va deplasa cu 3 caractere la fiecare iterație.
De asemenea, pachetul pandas este încărcat în mediu sub aliasul pd.
Acest exercițiu face parte din cursul
Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras
Instrucțiuni pentru exercițiu
- Împarte textul după caracterul de linie nouă pentru a itera prin propoziții.
- Parcurge propozițiile până la finalul acestora minus
chars_window. - Adaugă în variabila
sentencesporțiunea din propoziție care conținechars_windowcaractere și adaugă în variabilanext_charscaracterul următor. - Folosește vectorii obținuți pentru a crea un
pd.DataFrame()și afișează primele sale rânduri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
# Get 20 previous chars and next char; then shift by step
for i in range(0, len(sentence) - ____, step):
sentences.append(sentence[i:i + ____])
next_chars.append(sentence[____ + chars_window])
# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})
# Print the initial rows
print(df.head())