Začněte nyníZačněte zdarma

Identifikace profilů

Pokračujeme v prozkoumávání datové sady tweetů. Data jsou uložena v zanořeném seznamu s 5 055 podsezamy, který procházíme pomocí purrr.

V tomto cvičení si odpovíme na otázku týkající se chování uživatelů: kolik uživatelů pouze retweetuje, aniž by kdy zveřejnilo nějaký „původní obsah"? Obecné pravidlo na Twitteru říká, že přibližně 80 % lidí pouze retweetuje, zatímco 20 % publikuje vlastní obsah – v souladu s Paretovým zákonem. V tomto cvičení si to ověříme.

Aby to fungovalo, rozdělíme datovou sadu na dvě části a pak spočítáme celkový počet uživatelů a počet těch, kteří patří výhradně do skupiny „pouze retweety".

purrr je již načten a seznam rstudioconf máš v pracovním prostoru k dispozici.

Toto cvičení je součástí kurzu

Intermediate Functional Programming with purrr

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř podseznam retweetů, extrahuj prvek user_id a odstraň duplicity pomocí unique().

  • Vytvoř podseznam původních tweetů, extrahuj prvek user_id a odstraň duplicity pomocí unique().

  • Kombinací union() (ze základního R) a length() zjisti celkový počet uživatelů.

  • Pomocí funkce setdiff() (ze základního R) získej uživatele, kteří se nacházejí výhradně v podseznamu retweetů.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
  ___("user_id") %>% 
  ___()

# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
  ___("user_id") %>% 
  ___()

# Determine the total number of users
___(rt, non_rt) %>% ___()

# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()
Upravit a spustit kód