ÎncepețiÎncepe gratuit

Creează vectori de propoziții și caractere următoare

Acest exercițiu urmărește să sublinieze importanța pregătirii datelor. Vei folosi texte cu fraze ale personajului Sheldon din serialul The Big Bang Theory ca date de intrare și vei crea vectori de indecși de propoziții și caractere următoare, necesari înainte de a construi un model de generare de text.

Textul este disponibil în variabila sheldon, vocabularul (caracterele) se află în variabila vocabulary, iar hiperparametrii chars_window și step sunt definiți cu valorile 20 și, respectiv, 3. Aceasta înseamnă că o secvență de 20 de caractere va fi folosită pentru a prezice caracterul următor, iar fereastra se va deplasa cu 3 caractere la fiecare iterație.

De asemenea, pachetul pandas este încărcat în mediu sub aliasul pd.

Acest exercițiu face parte din cursul

Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte textul după caracterul de linie nouă pentru a itera prin propoziții.
  • Parcurge propozițiile până la finalul acestora minus chars_window.
  • Adaugă în variabila sentences porțiunea din propoziție care conține chars_window caractere și adaugă în variabila next_chars caracterul următor.
  • Folosește vectorii obținuți pentru a crea un pd.DataFrame() și afișează primele sale rânduri.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
    # Get 20 previous chars and next char; then shift by step
    for i in range(0, len(sentence) - ____, step):
        sentences.append(sentence[i:i + ____])
        next_chars.append(sentence[____ + chars_window])

# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})

# Print the initial rows
print(df.head())
Editează și rulează codul