EmpezarEmpieza gratis

Un extractor de contenido

En los ejercicios anteriores, comprobaste que todos los elementos del vector de URLs que te dieron devuelven un código de estado 200. Ahora que sabes que son accesibles, vamos a profundizar en el web scraping extrayendo contenido.

Para ello, usaremos funciones del paquete rvest, que rellenaremos por adelantado con partial(). Las funciones que escribiremos en este ejercicio extraerán todos los nodos HTML H2 de una página —en una web, estos nodos H2 corresponden a los encabezados de nivel 2—. Una vez extraídos estos títulos, usaremos la función html_text() para obtener el contenido de texto del HTML bruto.

purrr y rvest ya están cargados y el vector urls está disponible en tu espacio de trabajo.

Este ejercicio forma parte del curso

Programación funcional intermedia con purrr

Ver curso

Instrucciones del ejercicio

  • Empieza por precompletar html_nodes() con css = "h2".

  • Combina esta nueva función entre read_html y html_text para crear un extractor de texto para los encabezados H2.

  • Ejecuta esta función sobre el vector urls y asigna el resultado a un objeto con nombre.

  • Imprime el resultado para ver cómo queda.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Editar y ejecutar código