ÎncepețiÎncepe gratuit

Analiza URL-urilor

Continuăm explorarea setului de date #RStudioConf. În acest exercițiu, ne vom concentra pe analiza URL-urilor din tweet-uri.

URL-urile se găsesc într-un element numit "url_urls". Aceste elemente "url_urls" conțin fie NULL, dacă tweet-ul nu includea niciun URL, fie o listă cu unul sau mai multe URL-uri.

Vom începe prin a extrage toate elementele "url_urls" din setul de date, după care vom combina purrr și stringr pentru a număra câte tweet-uri conțin un link către un URL legat de GitHub. Deoarece GitHub este un site popular în rândul dezvoltatorilor, o prezență ridicată a acestuia în datele noastre va indica o comunitate puternică de dezvoltatori.

purrr și stringr sunt deja încărcate, iar setul de date rstudioconf este disponibil în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Programare funcțională intermediară cu purrr

Vezi cursul

Instrucțiuni pentru exercițiu

  • Extrage toate elementele "urls_url" și transmite rezultatul în flatten() pentru a elimina un nivel de ierarhie.

  • Elimină valorile NULL din rezultate.

  • Creează un mapper numit has_github, care detectează dacă un șir de caractere conține "github".

  • Folosește varianta map_*() pentru valori logice împreună cu has_github și transmite rezultatul în sum() pentru a număra câte link-uri conțin "github".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Editează și rulează codul