CommencezCommencez gratuitement

Faites-le à la manière de httr

Voici du code rvest que j'ai utilisé pour trouver l'altitude d'un endroit magnifique où j'ai passé mes dernières vacances.

# Get the HTML document from Wikipedia
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# Parse the document and extract the elevation from it
wikipedia_page %>% 
  html_elements('table tr:nth-child(9) > td') %>% 
  html_text()

Comme vous l'avez appris dans la vidéo, read_html() envoie en fait une requête HTTP GET lorsqu'on lui fournit une URL, comme ici.

L'objectif de cet exercice est de reproduire la même requête sans read_html(), mais plutôt avec les fonctions de httr.

Remarque : En général, rvest suffit. Toutefois, si vous voulez personnaliser vos requêtes, comme vous le verrez plus loin dans ce chapitre, vous devrez connaître la méthode avec httr.

Pour vous exercer, vous allez aussi traduire le sélecteur CSS utilisé dans html_elements() en une requête XPATH.

Cette activité fait partie du cours

Extraction de données Web en R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)
Modifier et exécuter le code