Robot d'indexation final
Cet exercice vous permet de mettre en valeur ce que vous avez appris ! Vous allez écrire la fonction parse d'une araignée (spider), puis remplir quelques champs pour la terminer. Sur la page de l'annuaire des cours de DataCamp, chaque cours répertorié affiche un titre et une brève description. Cette araignée servira à extraire les titres de cours et leurs courtes descriptions à partir de l'annuaire. Cette fois, vous n'aurez pas à suivre de liens. Voici tout ce que vous devez savoir :
- Les titres de cours se trouvent dans le texte d'un élément
h4dont la classe contient la chaîneblock__title(double soulignement). - Les courtes descriptions se trouvent dans le texte d'un paragraphe
pdont la classe contient la chaîneblock__description(double soulignement).
Cette activité fait partie du cours
Extraction de données Web en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr