Začněte nyníZačněte zdarma

Analýza URL

Pokračujeme v průzkumu datasetu #RStudioConf. V tomto cvičení se zaměříme na analýzu URL obsažených v tweetech.

URL adresy najdeme v elementu "url_urls". Tyto elementy "url_urls" obsahují buď NULL, pokud tweet žádnou URL neobsahoval, nebo seznam jedné či více URL adres.

Nejprve extrahujeme všechny elementy "url_urls" z datasetu a pak zkombinujeme purrr a stringr, abychom spočítali, kolik tweetů odkazuje na URL spojenou s GitHubem. Protože je GitHub oblíbená platforma mezi vývojáři, vysoký výskyt tohoto webu naznačí, že náš dataset obsahuje silnou vývojářskou komunitu.

purrr a stringr jsou již načteny a dataset rstudioconf je stále dostupný ve tvém workspace.

Toto cvičení je součástí kurzu

Intermediate Functional Programming with purrr

Zobrazit kurz

Pokyny k cvičení

  • Extrahuj všechny elementy "urls_url" a předej výsledek do funkce flatten(), která odstraní jednu úroveň hierarchie.

  • Odstraň z výsledků hodnoty NULL.

  • Vytvoř mapper s názvem has_github, který zjistí, zda řetězec znaků obsahuje "github".

  • Použij variantu map_*() pro logické hodnoty s mapperem has_github a předej výsledek do funkce sum(), abys spočítal/a počet odkazů obsahujících "github".

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Upravit a spustit kód