Začněte nyníZačněte zdarma

Seznámení s textovými daty

V tomto cvičení si pohraješ s textovými daty – konkrétně s citáty Sheldona Coopera ze seriálu Teorie velkého třesku. Získáš tak příležitost analyzovat věty a zjistit, jak to vypadá při práci s reálnými textovými daty.

Pomocí slovníkových comprehensions vytvoříš slovníky, které mapují slova na indexy a naopak. Slovníky místo například pandas.DataFrame volíme proto, že jsou intuitivnější a nepřidávají zbytečnou složitost.

Data jsou dostupná v proměnné sheldon_quotes – první dvě věty jsou už za tebe vypsané.

Toto cvičení je součástí kurzu

Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras

Zobrazit kurz

Pokyny k cvičení

  • Spoj věty do jedné proměnné pomocí join, extrahuj všechna slova a výsledný seznam ulož do all_words.
  • Odstraň duplicitní slova pomocí list(set()) na seznamu slov a výsledek ulož do unique_words.
  • Pomocí slovníkového comprehension vytvoř slovník, kde klíče jsou indexy a hodnoty jsou slova.
  • Pomocí slovníkového comprehension vytvoř slovník, kde klíče jsou slova a hodnoty jsou indexy.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Upravit a spustit kód