CommencezCommencez gratuitement

Lien hyper(actif)

Parmi les attributs les plus importants à extraire pour l'« web crawling », on retrouve l'URL d'hyperlien (l'attribut href) à l'intérieur d'une balise a. Ici, vous allez extraire un tel hyperlien! Nous avons créé la fonction print_attribute pour afficher les données extraites par votre XPath, afin que vous puissiez tester vos chaînes XPath dans la console si vous le souhaitez.

L'exercice se base sur le code source HTML suivant :

<html>
  <body>
    <div id="div1" class="class-1">
      <p class="class-1 class-2">Hello World!</p>
      <div id="div2">
        <p id="p2" class="class-2">Choose 
            <a href="http://datacamp.com">DataCamp!</a>!
        </p>
      </div>
    </div>
    <div id="div3" class="class-2">
      <p class="class-2">Thanks for Watching!</p>
    </div>
  </body>
</html>

Cette activité fait partie du cours

Extraction de données Web en Python

Voir le cours

Instructions de l’exercice

  • Complétez les espaces vides pour définir la variable xpath ci-dessous afin de sélectionner la valeur de l'attribut href de l'hyperlien DataCamp.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'

# Print out the selection(s); there should be only one
print_attribute( xpath )
Modifier et exécuter le code