or
Cette activité fait partie du cours
Découvrez la structure du HTML. Nous commençons par expliquer pourquoi l'extraction de données Web peut être un ajout utile à votre boîte à outils en science des données, puis nous abordons les bases du HTML. Nous terminons le chapitre par une brève introduction à la notation XPath, utilisée pour naviguer parmi les éléments du code HTML.
Exercice en cours
Exploitez la syntaxe XPath pour explorer les sélecteurs de scrapy. Ces deux notions vous rapprocheront de la capacité d'extraire le contenu d'un document HTML.
Apprenez la syntaxe des localisateurs CSS et commencez à expérimenter le chaînage de localisateurs CSS avec XPath. Nous présentons aussi les objets Response, qui se comportent comme des Selectors mais offrent des outils supplémentaires pour déployer nos efforts d'extraction sur plusieurs sites Web.
Apprenez à créer des robots d'exploration Web avec scrapy. Ces araignées scrapy parcourront le Web sur plusieurs pages, en suivant des liens pour extraire automatiquement chacune de ces pages selon les méthodes vues dans les chapitres précédents.