Hraní s tweety, round 1
Pamatuješ si, že jsi v posledních kapitolách tohoto kurzu pracoval/a jako datový analytik pro webovou agenturu? Odvedl/a jsi skvělou práci a teď tě čeká nový projekt ;) V této kapitole budeš analyzovat nový typ dat: výstup ve formátu JSON.
Tvůj tým vývojářů ti předal výstup ze sběru dat, který obsahuje tweety shromážděné během konference RStudio Conf 2018. Protože je tato datová sada ve formátu JSON, načetl/a sis ji v R jako vnořený seznam.
Nejdřív chceš provést základní průzkum této datové sady – a právě k tomu ti přijde vhod purrr. Balíček je už načtený a datová sada rstudioconf je dostupná v tvém pracovním prostředí.
Poznámka: nezkoušej vytisknout celou datovou sadu – je příliš velká na to, aby se zobrazila v konzoli DataCampu.
Měj na paměti, že jde o reálná data z Twitteru, a proto existuje riziko, že mohou obsahovat vulgarity nebo jiný nevhodný obsah (platí pro toto i všechna následující cvičení pracující s reálnými daty z Twitteru).
Toto cvičení je součástí kurzu
Intermediate Functional Programming with purrr
Pokyny k cvičení
Vypiš první prvek seznamu, abys získal/a přehled o obsahu a struktuře.
Protože se chceš zaměřit na původní tweety (ne retweety), vytvoř podseznam neretweetů pomocí logického prvku
"is_retweet"obsaženého v každém podseznam.Z každého prvku tohoto nového podseznamu extrahuj element
"favorite_count"pomocí variantymap_*určené pro celá čísla.Vypočítej medián předchozího výsledku.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)