Vytvoření vektorů vět a následujících znaků
Toto cvičení zdůrazňuje důležitost přípravy dat. Jako vstup použiješ texty s frázemi postavy Sheldona z televizního seriálu Teorie velkého třesku a vytvoříš vektory indexů vět a následujících znaků, které jsou potřeba před vytvořením modelu pro generování textu.
Text je dostupný v proměnné sheldon, slovník (znaky) v proměnné vocabulary a hyperparametry chars_window a step mají nastavené hodnoty 20 a 3. To znamená, že k předpovědi dalšího znaku se použije sekvence 20 znaků a okno se při každé iteraci posune o 3 znaky.
V prostředí je také načten balíček pandas jako pd.
Toto cvičení je součástí kurzu
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras
Pokyny k cvičení
- Rozděl text podle zalomení řádku, abys mohl/a procházet jednotlivé věty.
- Procházej smyčku až do konce věty minus
chars_window. - Přidej část věty o délce
chars_windowznaků do proměnnésentencesa následující znak přidej do proměnnénext_chars. - Pomocí získaných vektorů vytvoř
pd.DataFrame()a vypiš jeho první řádky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
# Get 20 previous chars and next char; then shift by step
for i in range(0, len(sentence) - ____, step):
sentences.append(sentence[i:i + ____])
next_chars.append(sentence[____ + chars_window])
# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})
# Print the initial rows
print(df.head())