Skupinové souhrny
Takže v twitter_data je více nestížností než stížností. Možná tě napadá, jestli tato data vůbec pocházejí z Twitteru! V twitter_data je ale ještě několik dalších zajímavých sloupců, které stojí za prozkoumání, než se pustíš do samotných tweetů. Každý tweet obsahuje počet sledujících daného uživatele ve sloupci usr_followers_count. Myslíš, že ti, kdo si stěžují, mají v průměru více sledujících, nebo méně než ti, kdo si nestěžují? Skupinové souhrny ti na tuto otázku rychle a snadno odpoví.
Toto cvičení je součástí kurzu
Úvod do analýzy textu v R
Pokyny k cvičení
- Seskup data podle
complaint_label. - Vypočítej průměrný, minimální a maximální počet
usr_followers_count.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Start with the data frame
___ %>%
# Group the data by whether or not the tweet is a complaint
___(___) %>%
# Compute the mean, min, and max follower counts
summarize(
avg_followers = ___(___),
min_followers = ___(___),
max_followers = ___(___)
)