De vuelta a la oficina
Sigues trabajando como analista de datos en una agencia web y te han pedido hacer web scraping. Te han dado una lista de URLs para analizar, un análisis que ya empezaste en el capítulo anterior.
Esperas que esta tarea sea recurrente: no hay duda de que te la pedirán de nuevo dentro de unas semanas. Para facilitarte el trabajo futuro, has decidido escribir código limpio hoy, de modo que te resulte más fácil retomarlo más adelante.
Empezaremos combinando las dos funciones de httr que vimos en el capítulo anterior: GET(), para recuperar la página web, y status_code(), para extraer el código de estado, con el fin de crear un extractor de códigos de estado.
El vector urls sigue disponible en tu espacio de trabajo. Hemos mantenido solo las URLs que son accesibles.
Este ejercicio forma parte del curso
Programación funcional intermedia con purrr
Instrucciones del ejercicio
Carga
purrryhttr.Compón un extractor de estado con
GET()ystatus_code().Prueba esta nueva función en "https://www.thinkr.fr" y "https://en.wikipedia.org".
Aplica esta función directamente al vector
urls.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)