Transformer un tableau en trame de données avec html_table()
Si un tableau comporte une ligne d'en-tête (avec des éléments th) et aucune lacune, l'extraction est simple, comme pour le tableau suivant (ayant l'ID "clean") :
| Mountain | Height | First ascent | Country |
|---|---|---|---|
| Mount Everest | 8848 | 1953 | Nepal, China |
| ... |
Voici le même tableau (ayant l'ID "dirty") sans ligne d'en-tête désignée et avec une cellule manquante dans la première ligne :
| Mountain | Height | First ascent | Country |
| Mount Everest | 8848 | 1953 | |
| ... |
Pour ces cas, html_table() offre un argument supplémentaire que vous pouvez utiliser pour bien analyser le tableau, comme montré dans la vidéo. Les cellules manquantes sont automatiquement reconnues et remplacées par des valeurs NA.
Les deux tableaux se trouvent dans le document mountains_html.
Cette activité fait partie du cours
Extraction de données Web en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Extract the "clean" table into a data frame
mountains <- mountains_html %>%
html_element("table#clean") %>%
___
mountains