Lek med tweets, omgång 1
Minns du att du jobbade som dataanalytiker åt en webbyrå i de tidigare kapitlen av den här kursen? Du har gjort ett riktigt bra jobb, och nu har du fått ett nytt projekt ;) I det här kapitlet analyserar du en ny typ av data: JSON-utdata.
Ditt teknikteam har gett dig resultatet av en datainsamling med tweets som samlades in under RStudio Conf 2018. Eftersom datamängden är i JSON-format har du läst in den som en nästlad lista i R.
Först vill du göra en grundläggande utforskning av datamängden, och purrr kommer väl till pass för det. Paketet har redan laddats in åt dig, och datamängden rstudioconf finns tillgänglig i din arbetsmiljö.
Obs! Försök inte skriva ut hela datamängden – den är för stor för att visas i DataCamp-konsolen.
Tänk på att det här är verklig data från Twitter, vilket innebär att den kan innehålla svordomar eller annat stötande innehåll (i den här övningen och i efterföljande övningar som också använder verklig Twitter-data).
Den här övningen är en del av kursen
Funktionell programmering på mellannivå med purrr
Övningsinstruktioner
Skriv ut det första elementet i listan för att få en överblick över innehåll och struktur.
Eftersom du vill fokusera på ursprungliga tweets (inte retweets) skapar du en underlista med icke-retweets med hjälp av det logiska elementet
"is_retweet"i varje underlista.Extrahera elementet
"favorite_count"ur varje element i den nya underlistan med hjälp av denmap_*-variant som är avsedd för heltal.Beräkna medianen av det föregående resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the first element of the list to the console
# Create a sublist of non-retweets
non_rt <- ___(___, "is_retweet")
# Extract the favorite count element of each non_rt sublist
fav_count <- ___(___, "favorite_count")
# Get the median of favorite_count for non_rt
___(___)