CommencezCommencez gratuitement

Noms de plume

Dans cet exercice, nous avons préparé une classe d'araignée (spider) qui, une fois complétée, récupérera les noms des auteurs à partir d'une version abrégée du répertoire de cours de DataCamp. L'URL de cette version abrégée est stockée dans la variable url_short. Votre tâche consiste à créer la liste des noms d'auteurs extraits dans la méthode parse de l'araignée.

Deux éléments à savoir :

  • Vous utiliserez l'objet response et la méthode css ici.
  • Les noms des auteurs de cours correspondent au texte des éléments de paragraphe p appartenant à la classe course-block__author-name.

Vous pouvez inspecter l'araignée avec la fonction inspect_spider() que nous avons préparée pour vous — elle affichera les noms d'auteurs que vous trouvez !

Notez que cet exercice et les suivants dans ce chapitre peuvent prendre un certain temps à se charger.

Cette activité fait partie du cours

Extraction de données Web en Python

Voir le cours

Instructions de l’exercice

  • Indiquez les arguments requis de la méthode parse afin qu'elle fonctionne comme prévu lorsqu'elle est appelée dans la méthode start_requests.
  • Dans la méthode parse, créez une variable author_names, qui est une liste de chaînes obtenues en extrayant le texte des éléments de paragraphe appartenant à la classe course-block__author-name.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
Modifier et exécuter le code