Seznámení s textovými daty
V tomto cvičení si pohraješ s textovými daty – konkrétně s citáty Sheldona Coopera ze seriálu Teorie velkého třesku. Získáš tak příležitost analyzovat věty a zjistit, jak to vypadá při práci s reálnými textovými daty.
Pomocí slovníkových comprehensions vytvoříš slovníky, které mapují slova na indexy a naopak. Slovníky místo například pandas.DataFrame volíme proto, že jsou intuitivnější a nepřidávají zbytečnou složitost.
Data jsou dostupná v proměnné sheldon_quotes – první dvě věty jsou už za tebe vypsané.
Toto cvičení je součástí kurzu
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras
Pokyny k cvičení
- Spoj věty do jedné proměnné pomocí
join, extrahuj všechna slova a výsledný seznam ulož doall_words. - Odstraň duplicitní slova pomocí
list(set())na seznamu slov a výsledek ulož dounique_words. - Pomocí slovníkového comprehension vytvoř slovník, kde klíče jsou indexy a hodnoty jsou slova.
- Pomocí slovníkového comprehension vytvoř slovník, kde klíče jsou slova a hodnoty jsou indexy.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)