CommencezCommencez gratuitement

Tirer parti de l'unicité des ID

Comme vous le savez, les ID devraient être uniques sur une page Web. Si vous pouvez vous en assurer, cela peut réduire considérablement la complexité de vos sélecteurs d'extraction.

Voici la structure d'une page HTML que vous pourriez rencontrer dans la nature :

<html>
  <body>
    <div id = 'first'>
      <h1 class = 'big'>Joe Biden</h1>
      <p class = 'first blue'>Democrat</p>
      <p class = 'second blue'>Male</p>
    </div>
    <div id = 'second'>...</div>
    <div id = 'third'>
      <h1 class = 'big'>Donald Trump</h1>
      <p class = 'first red'>Republican</p>
      <p class = 'second red'>Male</p>
    </div>
  </body>
</html>

Elle a été chargée pour vous avec read_html() et est accessible via structured_html.

Cette activité fait partie du cours

Extraction de données Web en R

Voir le cours

Instructions de l’exercice

  • À l'aide de html_elements(), trouvez le sélecteur le plus court possible pour sélectionner le premier div dans structured_html.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Select the first div
structured_html %>%
  ___
Modifier et exécuter le code