Tirer parti de l'unicité des ID
Comme vous le savez, les ID devraient être uniques sur une page Web. Si vous pouvez vous en assurer, cela peut réduire considérablement la complexité de vos sélecteurs d'extraction.
Voici la structure d'une page HTML que vous pourriez rencontrer dans la nature :
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Joe Biden</h1>
<p class = 'first blue'>Democrat</p>
<p class = 'second blue'>Male</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<h1 class = 'big'>Donald Trump</h1>
<p class = 'first red'>Republican</p>
<p class = 'second red'>Male</p>
</div>
</body>
</html>
Elle a été chargée pour vous avec read_html() et est accessible via structured_html.
Cette activité fait partie du cours
Extraction de données Web en R
Instructions de l’exercice
- À l'aide de
html_elements(), trouvez le sélecteur le plus court possible pour sélectionner le premierdivdansstructured_html.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Select the first div
structured_html %>%
___