Začněte nyníZačněte zdarma

Extrakce zmínek

V každém podseznam datasetu tweetů se nachází prvek "mentions_screen_name" (tedy Twitter handles). Tento prvek obsahuje buď NULL, pokud tweet žádnou zmínku neobsahoval, nebo jedno či více uživatelských jmen zmíněných v tweetu. Jedním ze způsobů, jak z kolekce tweetů identifikovat populární účty, je zjistit, kteří uživatelé jsou zmiňováni nejčastěji.

Nejprve extrahujeme vektor všech zmínek a poté spočítáme, kolikrát je každý profil zmíněn. K tomu sestavíme novou složenou funkci kombinací table() (která počítá výskyty každého prvku ve vektoru), sort() a tail().

purrr je již načtený a dataset rstudioconf máš k dispozici.

Toto cvičení je součástí kurzu

Intermediate Functional Programming with purrr

Zobrazit kurz

Pokyny k cvičení

  • Sestav funkci, která kombinuje as_vector(), compact() a flatten().

  • Vytvoř funkci, která přijímá dva argumenty: list a what. Tato funkce spustí map( list, what ) a předá výsledek do flatten_to_vector.

  • Vytvoř six_most — funkci, která kombinuje tail(), sort() a table().

  • Spusť extractor() na datasetu rstudioconf a výsledek předej do six_most().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Combine as_vector(), compact(), and flatten()
flatten_to_vector <- ___(___, ___, ___)

# Complete the function
extractor <- function(list, what = "mentions_screen_name"){
  map( ___ , ___ ) %>%
    ___()
}

# Create six_most, with tail(), sort(), and table()
six_most <- ___(___, ___, ___)

# Run extractor() on rstudioconf
___(rstudioconf) %>% 
  ___()
Upravit a spustit kód