Un extractor de contenido
En los ejercicios anteriores, comprobaste que todos los elementos del vector de URLs que te dieron devuelven un código de estado 200. Ahora que sabes que son accesibles, vamos a profundizar en el web scraping extrayendo contenido.
Para ello, usaremos funciones del paquete rvest, que rellenaremos por adelantado con partial(). Las funciones que escribiremos en este ejercicio extraerán todos los nodos HTML H2 de una página —en una web, estos nodos H2 corresponden a los encabezados de nivel 2—. Una vez extraídos estos títulos, usaremos la función html_text() para obtener el contenido de texto del HTML bruto.
purrr y rvest ya están cargados y el vector urls está disponible en tu espacio de trabajo.
Este ejercicio forma parte del curso
Programación funcional intermedia con purrr
Instrucciones del ejercicio
Empieza por precompletar
html_nodes()concss = "h2".Combina esta nueva función entre
read_htmlyhtml_textpara crear un extractor de texto para los encabezadosH2.Ejecuta esta función sobre el vector
urlsy asigna el resultado a un objeto con nombre.Imprime el resultado para ver cómo queda.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___