CommencezCommencez gratuitement

Robot d'indexation final

Cet exercice vous permet de mettre en valeur ce que vous avez appris ! Vous allez écrire la fonction parse d'une araignée (spider), puis remplir quelques champs pour la terminer. Sur la page de l'annuaire des cours de DataCamp, chaque cours répertorié affiche un titre et une brève description. Cette araignée servira à extraire les titres de cours et leurs courtes descriptions à partir de l'annuaire. Cette fois, vous n'aurez pas à suivre de liens. Voici tout ce que vous devez savoir :

  • Les titres de cours se trouvent dans le texte d'un élément h4 dont la classe contient la chaîne block__title (double soulignement).
  • Les courtes descriptions se trouvent dans le texte d'un paragraphe p dont la classe contient la chaîne block__description (double soulignement).

Cette activité fait partie du cours

Extraction de données Web en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
Modifier et exécuter le code