CommencezCommencez gratuitement

De retour au bureau

Vous travaillez toujours comme analyste de données dans une agence Web, et on vous a demandé de faire de l'exploration de données Web (web scraping). On vous a fourni une liste d'URL à analyser, une analyse que vous avez déjà commencée au chapitre précédent.

Vous vous attendez à ce que cette tâche revienne régulièrement : il ne fait aucun doute qu'on vous le redemandera dans quelques semaines. Pour vous faciliter la vie plus tard, vous avez décidé d'écrire dès aujourd'hui du code propre et clair, afin qu'il soit plus simple d'y revenir.

Nous allons commencer par combiner deux fonctions de httr vues au chapitre précédent : GET(), pour récupérer la page Web, et status_code(), pour extraire le code d'état, afin de créer un extracteur de code d'état.

Le vecteur urls est toujours disponible dans votre espace de travail. Nous avons conservé uniquement les URL accessibles.

Cette activité fait partie du cours

Programmation fonctionnelle intermédiaire avec purrr

Voir le cours

Instructions de l’exercice

  • Chargez purrr et httr.

  • Composez un extracteur de statut avec GET() et status_code().

  • Essayez cette nouvelle fonction sur "https://www.thinkr.fr" et "https://en.wikipedia.org".

  • Appliquez directement cette fonction au vecteur urls.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Modifier et exécuter le code