EmpezarEmpieza gratis

Analizando URLs

Seguimos con la exploración del conjunto de datos de #RStudioConf. En este ejercicio, nos centraremos en analizar las URLs incluidas en los tuits.

Las URLs se encuentran en un elemento llamado "url_urls". Estos elementos "url_urls" contienen NULL si no había ninguna URL en el tuit, o una lista con una o más URLs.

Empezaremos extrayendo todos los elementos "url_urls" del conjunto de datos y luego combinaremos purrr y stringr para contar cuántos tuits incluyen un enlace a una URL relacionada con GitHub. Dado que GitHub es un sitio muy popular entre desarrolladores, una alta presencia de este sitio indicará una comunidad de desarrolladores sólida en nuestro conjunto de datos.

purrr y stringr ya están cargados, y el conjunto de datos rstudioconf sigue disponible en tu espacio de trabajo.

Este ejercicio forma parte del curso

Programación funcional intermedia con purrr

Ver curso

Instrucciones del ejercicio

  • Extrae todos los elementos "urls_url" y pasa el resultado a flatten() para eliminar un nivel de jerarquía.

  • Elimina los NULL de los resultados.

  • Crea un mapper llamado has_github, que detecte si una cadena de caracteres contiene "github".

  • Usa la variante de map_*() para lógicos con has_github y pásala a sum() para contar el número de enlaces que contienen "github".

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Editar y ejecutar código