Analiza URL-urilor
Continuăm explorarea setului de date #RStudioConf. În acest exercițiu, ne vom concentra pe analiza URL-urilor din tweet-uri.
URL-urile se găsesc într-un element numit "url_urls". Aceste elemente "url_urls" conțin fie NULL, dacă tweet-ul nu includea niciun URL, fie o listă cu unul sau mai multe URL-uri.
Vom începe prin a extrage toate elementele "url_urls" din setul de date, după care vom combina purrr și stringr pentru a număra câte tweet-uri conțin un link către un URL legat de GitHub. Deoarece GitHub este un site popular în rândul dezvoltatorilor, o prezență ridicată a acestuia în datele noastre va indica o comunitate puternică de dezvoltatori.
purrr și stringr sunt deja încărcate, iar setul de date rstudioconf este disponibil în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Programare funcțională intermediară cu purrr
Instrucțiuni pentru exercițiu
Extrage toate elementele
"urls_url"și transmite rezultatul înflatten()pentru a elimina un nivel de ierarhie.Elimină valorile
NULLdin rezultate.Creează un mapper numit
has_github, care detectează dacă un șir de caractere conține"github".Folosește varianta
map_*()pentru valori logice împreună cuhas_githubși transmite rezultatul însum()pentru a număra câte link-uri conțin"github".
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()