Sélectionner par classe et ID avec XPATH
Voici un extrait HTML semblable à celui que vous avez vu au chapitre précédent (déjà lu dans un document HTML appelé weather_html) :
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Berlin Weather Station</h1>
<p class = 'first'>Temperature: 20°C</p>
<p class = 'second'>Humidity: 45%</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<p class = 'first'>Sunshine: 5hrs</p>
<p class = 'second'>Precipitation: 0mm</p>
</div>
</body>
</html>
Dans ce chapitre, ce code ressemble davantage à un cas réel. Votre objectif est d'extraire la valeur des précipitations de cette station météo. Malheureusement, on ne peut pas y faire référence directement avec un ID.
Procédons étape par étape pour créer les bons éléments de base, puis combinez-les !
Cette activité fait partie du cours
Extraction de données Web en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Select all p elements
weather_html %>%
html_elements(xpath = '___')