Identifikace profilů
Pokračujeme v prozkoumávání datové sady tweetů. Data jsou uložena v zanořeném seznamu s 5 055 podsezamy, který procházíme pomocí purrr.
V tomto cvičení si odpovíme na otázku týkající se chování uživatelů: kolik uživatelů pouze retweetuje, aniž by kdy zveřejnilo nějaký „původní obsah"? Obecné pravidlo na Twitteru říká, že přibližně 80 % lidí pouze retweetuje, zatímco 20 % publikuje vlastní obsah – v souladu s Paretovým zákonem. V tomto cvičení si to ověříme.
Aby to fungovalo, rozdělíme datovou sadu na dvě části a pak spočítáme celkový počet uživatelů a počet těch, kteří patří výhradně do skupiny „pouze retweety".
purrr je již načten a seznam rstudioconf máš v pracovním prostoru k dispozici.
Toto cvičení je součástí kurzu
Intermediate Functional Programming with purrr
Pokyny k cvičení
Vytvoř podseznam retweetů, extrahuj prvek
user_ida odstraň duplicity pomocíunique().Vytvoř podseznam původních tweetů, extrahuj prvek
user_ida odstraň duplicity pomocíunique().Kombinací
union()(ze základního R) alength()zjisti celkový počet uživatelů.Pomocí funkce
setdiff()(ze základního R) získej uživatele, kteří se nacházejí výhradně v podseznamu retweetů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
___("user_id") %>%
___()
# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
___("user_id") %>%
___()
# Determine the total number of users
___(rt, non_rt) %>% ___()
# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()