Začněte nyníZačněte zdarma

Vytvoření vektorů vět a následujících znaků

Toto cvičení zdůrazňuje důležitost přípravy dat. Jako vstup použiješ texty s frázemi postavy Sheldona z televizního seriálu Teorie velkého třesku a vytvoříš vektory indexů vět a následujících znaků, které jsou potřeba před vytvořením modelu pro generování textu.

Text je dostupný v proměnné sheldon, slovník (znaky) v proměnné vocabulary a hyperparametry chars_window a step mají nastavené hodnoty 20 a 3. To znamená, že k předpovědi dalšího znaku se použije sekvence 20 znaků a okno se při každé iteraci posune o 3 znaky.

V prostředí je také načten balíček pandas jako pd.

Toto cvičení je součástí kurzu

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Zobrazit kurz

Pokyny k cvičení

  • Rozděl text podle zalomení řádku, abys mohl/a procházet jednotlivé věty.
  • Procházej smyčku až do konce věty minus chars_window.
  • Přidej část věty o délce chars_window znaků do proměnné sentences a následující znak přidej do proměnné next_chars.
  • Pomocí získaných vektorů vytvoř pd.DataFrame() a vypiš jeho první řádky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
    # Get 20 previous chars and next char; then shift by step
    for i in range(0, len(sentence) - ____, step):
        sentences.append(sentence[i:i + ____])
        next_chars.append(sentence[____ + chars_window])

# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})

# Print the initial rows
print(df.head())
Upravit a spustit kód