EmpezarEmpieza gratis

De vuelta a la oficina

Sigues trabajando como analista de datos en una agencia web y te han pedido hacer web scraping. Te han dado una lista de URLs para analizar, un análisis que ya empezaste en el capítulo anterior.

Esperas que esta tarea sea recurrente: no hay duda de que te la pedirán de nuevo dentro de unas semanas. Para facilitarte el trabajo futuro, has decidido escribir código limpio hoy, de modo que te resulte más fácil retomarlo más adelante.

Empezaremos combinando las dos funciones de httr que vimos en el capítulo anterior: GET(), para recuperar la página web, y status_code(), para extraer el código de estado, con el fin de crear un extractor de códigos de estado.

El vector urls sigue disponible en tu espacio de trabajo. Hemos mantenido solo las URLs que son accesibles.

Este ejercicio forma parte del curso

Programación funcional intermedia con purrr

Ver curso

Instrucciones del ejercicio

  • Carga purrr y httr.

  • Compón un extractor de estado con GET() y status_code().

  • Prueba esta nueva función en "https://www.thinkr.fr" y "https://en.wikipedia.org".

  • Aplica esta función directamente al vector urls.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Editar y ejecutar código