Lien hyper(actif)
Parmi les attributs les plus importants à extraire pour l'« web crawling », on retrouve l'URL d'hyperlien (l'attribut href) à l'intérieur d'une balise a. Ici, vous allez extraire un tel hyperlien! Nous avons créé la fonction print_attribute pour afficher les données extraites par votre XPath, afin que vous puissiez tester vos chaînes XPath dans la console si vous le souhaitez.
L'exercice se base sur le code source HTML suivant :
<html>
<body>
<div id="div1" class="class-1">
<p class="class-1 class-2">Hello World!</p>
<div id="div2">
<p id="p2" class="class-2">Choose
<a href="http://datacamp.com">DataCamp!</a>!
</p>
</div>
</div>
<div id="div3" class="class-2">
<p class="class-2">Thanks for Watching!</p>
</div>
</body>
</html>
Cette activité fait partie du cours
Extraction de données Web en Python
Instructions de l’exercice
- Complétez les espaces vides pour définir la variable
xpathci-dessous afin de sélectionner la valeur de l'attributhrefde l'hyperlien DataCamp.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'
# Print out the selection(s); there should be only one
print_attribute( xpath )