Počítání podle produktu a přeuspořádání
tidy_twitter byl tokenizován a stop slova, včetně vlastních stop slov, byla odstraněna. Teď chceš vizualizovat rozdíly v počtech slov podle toho, zda se jedná o stížnosti, nebo ne.
Toto cvičení je součástí kurzu
Úvod do analýzy textu v R
Pokyny k cvičení
- Spočítej slova podle toho, zda jde o stížnost, nebo ne.
- Ponech 20 nejčastějších slov pro každou kategorii (stížnost / nestížnost).
- Před přeuspořádáním slova jako faktoru podle počtu zruš seskupení.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
word_counts <- tidy_twitter %>%
# Count words by whether or not its a complaint
___(___, ___) %>%
# Group by whether or not its a complaint
group_by(___) %>%
# Keep the top 20 words
___(___, ___) %>%
# Ungroup before reordering word as a factor by the count
___() %>%
___(word2 = ___(___, ___))