Noms de plume
Dans cet exercice, nous avons préparé une classe d'araignée (spider) qui, une fois complétée, récupérera les noms des auteurs à partir d'une version abrégée du répertoire de cours de DataCamp. L'URL de cette version abrégée est stockée dans la variable url_short. Votre tâche consiste à créer la liste des noms d'auteurs extraits dans la méthode parse de l'araignée.
Deux éléments à savoir :
- Vous utiliserez l'objet
responseet la méthodecssici. - Les noms des auteurs de cours correspondent au texte des éléments de paragraphe
pappartenant à la classecourse-block__author-name.
Vous pouvez inspecter l'araignée avec la fonction inspect_spider() que nous avons préparée pour vous — elle affichera les noms d'auteurs que vous trouvez !
Notez que cet exercice et les suivants dans ce chapitre peuvent prendre un certain temps à se charger.
Cette activité fait partie du cours
Extraction de données Web en Python
Instructions de l’exercice
- Indiquez les arguments requis de la méthode
parseafin qu'elle fonctionne comme prévu lorsqu'elle est appelée dans la méthodestart_requests. - Dans la méthode
parse, créez une variableauthor_names, qui est une liste de chaînes obtenues en extrayant le texte des éléments de paragraphe appartenant à la classecourse-block__author-name.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )