CommencerCommencez gratuitement

Retour au bureau

Vous travaillez toujours comme data analyst dans une agence web, et l’on vous a demandé de faire du web scraping. On vous a transmis une liste d’URL à analyser : vous avez déjà commencé cette analyse au chapitre précédent.

Vous vous attendez à ce que cette tâche revienne régulièrement : nul doute qu’on vous la redemandera dans quelques semaines. Pour vous faciliter le travail plus tard, vous avez décidé d’écrire dès aujourd’hui un code propre, afin qu’il soit facile à reprendre.

Nous allons commencer par combiner les deux fonctions de httr vues au chapitre précédent : GET(), pour récupérer la page web, et status_code(), pour extraire le code de statut, afin de créer un extracteur de code de statut.

Le vecteur urls est toujours disponible dans votre espace de travail. Nous n’avons conservé que les URL accessibles.

Cet exercice fait partie du cours

<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>
Voir le cours

Instructions de l’exercice

  • Chargez purrr et httr.

  • Composez un extracteur de statut avec GET() et status_code().

  • Testez cette nouvelle fonction sur "https://www.thinkr.fr" et "https://en.wikipedia.org".

  • Appliquez directement cette fonction au vecteur urls.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Modifier et exécuter le code