Začněte nyníZačněte zdarma

Řídké matice

Ve videolekci ses seznámil/a s řídkými maticemi. S rostoucím počtem textových dokumentů a unikátních slov se řídké matice mohou stát výpočetním noční můrou. Při práci s tweety vznikají řídké matice velmi snadno, protože lidé používají emoji, slang, zkratky a další nestandardní formy jazyka.

V tomto cvičení projdeš kroky, které ti ukážou, jak řídká je datová sada ruských tweetů. Jde o malý, ale výmluvný příklad toho, jak rychle se textová analýza může stát výpočetně náročným problémem.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
Upravit a spustit kód