Analýza URL
Pokračujeme v průzkumu datasetu #RStudioConf. V tomto cvičení se zaměříme na analýzu URL obsažených v tweetech.
URL adresy najdeme v elementu "url_urls". Tyto elementy "url_urls" obsahují buď NULL, pokud tweet žádnou URL neobsahoval, nebo seznam jedné či více URL adres.
Nejprve extrahujeme všechny elementy "url_urls" z datasetu a pak zkombinujeme purrr a stringr, abychom spočítali, kolik tweetů odkazuje na URL spojenou s GitHubem. Protože je GitHub oblíbená platforma mezi vývojáři, vysoký výskyt tohoto webu naznačí, že náš dataset obsahuje silnou vývojářskou komunitu.
purrr a stringr jsou již načteny a dataset rstudioconf je stále dostupný ve tvém workspace.
Toto cvičení je součástí kurzu
Intermediate Functional Programming with purrr
Pokyny k cvičení
Extrahuj všechny elementy
"urls_url"a předej výsledek do funkceflatten(), která odstraní jednu úroveň hierarchie.Odstraň z výsledků hodnoty
NULL.Vytvoř mapper s názvem
has_github, který zjistí, zda řetězec znaků obsahuje"github".Použij variantu
map_*()pro logické hodnoty s mapperemhas_githuba předej výsledek do funkcesum(), abys spočítal/a počet odkazů obsahujících"github".
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()