De retour au bureau
Vous travaillez toujours comme analyste de données dans une agence Web, et on vous a demandé de faire de l'exploration de données Web (web scraping). On vous a fourni une liste d'URL à analyser, une analyse que vous avez déjà commencée au chapitre précédent.
Vous vous attendez à ce que cette tâche revienne régulièrement : il ne fait aucun doute qu'on vous le redemandera dans quelques semaines. Pour vous faciliter la vie plus tard, vous avez décidé d'écrire dès aujourd'hui du code propre et clair, afin qu'il soit plus simple d'y revenir.
Nous allons commencer par combiner deux fonctions de httr vues au chapitre précédent : GET(), pour récupérer la page Web, et status_code(), pour extraire le code d'état, afin de créer un extracteur de code d'état.
Le vecteur urls est toujours disponible dans votre espace de travail. Nous avons conservé uniquement les URL accessibles.
Cette activité fait partie du cours
Programmation fonctionnelle intermédiaire avec purrr
Instructions de l’exercice
Chargez
purrrethttr.Composez un extracteur de statut avec
GET()etstatus_code().Essayez cette nouvelle fonction sur "https://www.thinkr.fr" et "https://en.wikipedia.org".
Appliquez directement cette fonction au vecteur
urls.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)