Retour au bureau
Vous travaillez toujours comme data analyst dans une agence web, et l’on vous a demandé de faire du web scraping. On vous a transmis une liste d’URL à analyser : vous avez déjà commencé cette analyse au chapitre précédent.
Vous vous attendez à ce que cette tâche revienne régulièrement : nul doute qu’on vous la redemandera dans quelques semaines. Pour vous faciliter le travail plus tard, vous avez décidé d’écrire dès aujourd’hui un code propre, afin qu’il soit facile à reprendre.
Nous allons commencer par combiner les deux fonctions de httr vues au chapitre précédent : GET(), pour récupérer la page web, et status_code(), pour extraire le code de statut, afin de créer un extracteur de code de statut.
Le vecteur urls est toujours disponible dans votre espace de travail. Nous n’avons conservé que les URL accessibles.
Cet exercice fait partie du cours
<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>Instructions de l’exercice
Chargez
purrrethttr.Composez un extracteur de statut avec
GET()etstatus_code().Testez cette nouvelle fonction sur "https://www.thinkr.fr" et "https://en.wikipedia.org".
Appliquez directement cette fonction au vecteur
urls.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)