Extrakce zmínek
V každém podseznam datasetu tweetů se nachází prvek "mentions_screen_name" (tedy Twitter handles). Tento prvek obsahuje buď NULL, pokud tweet žádnou zmínku neobsahoval, nebo jedno či více uživatelských jmen zmíněných v tweetu. Jedním ze způsobů, jak z kolekce tweetů identifikovat populární účty, je zjistit, kteří uživatelé jsou zmiňováni nejčastěji.
Nejprve extrahujeme vektor všech zmínek a poté spočítáme, kolikrát je každý profil zmíněn. K tomu sestavíme novou složenou funkci kombinací table() (která počítá výskyty každého prvku ve vektoru), sort() a tail().
purrr je již načtený a dataset rstudioconf máš k dispozici.
Toto cvičení je součástí kurzu
Intermediate Functional Programming with purrr
Pokyny k cvičení
Sestav funkci, která kombinuje
as_vector(),compact()aflatten().Vytvoř funkci, která přijímá dva argumenty:
listawhat. Tato funkce spustímap( list, what )a předá výsledek doflatten_to_vector.Vytvoř
six_most— funkci, která kombinujetail(),sort()atable().Spusť
extractor()na dataseturstudioconfa výsledek předej dosix_most().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Combine as_vector(), compact(), and flatten()
flatten_to_vector <- ___(___, ___, ___)
# Complete the function
extractor <- function(list, what = "mentions_screen_name"){
map( ___ , ___ ) %>%
___()
}
# Create six_most, with tail(), sort(), and table()
six_most <- ___(___, ___, ___)
# Run extractor() on rstudioconf
___(rstudioconf) %>%
___()