Řídké matice
Ve videolekci ses seznámil/a s řídkými maticemi. S rostoucím počtem textových dokumentů a unikátních slov se řídké matice mohou stát výpočetním noční můrou. Při práci s tweety vznikají řídké matice velmi snadno, protože lidé používají emoji, slang, zkratky a další nestandardní formy jazyka.
V tomto cvičení projdeš kroky, které ti ukážou, jak řídká je datová sada ruských tweetů. Jde o malý, ale výmluvný příklad toho, jak rychle se textová analýza může stát výpočetně náročným problémem.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)