Pseudonime
În acest exercițiu, am pregătit o clasă spider care, odată finalizată, va prelua numele autorilor dintr-o versiune prescurtată a directorului de cursuri DataCamp. URL-ul pentru versiunea prescurtată este stocat în variabila url_short. Sarcina ta este să creezi lista de nume de autori extrase în metoda parse a spider-ului.
Două lucruri de reținut:
- Vei folosi obiectul
responseși metodacss. - Numele autorilor de cursuri sunt definite de textul din elementele de tip paragraf
paparținând claseicourse-block__author-name
Poți inspecta spider-ul folosind funcția inspect_spider() pe care am construit-o pentru tine -- va afișa numele autorilor găsite!
Reține că acest exercițiu și cele rămase din capitol pot dura ceva timp să se încarce.
Acest exercițiu face parte din cursul
Web Scraping în Python
Instrucțiuni pentru exercițiu
- Completează argumentele necesare metodei parse, astfel încât să funcționeze corect când este apelată în metoda
start_requests. - În interiorul metodei
parse, creează o variabilăauthor_names, care este o listă de șiruri obținută prin extragerea textului din elementele de tip paragraf aparținând claseicourse-block__author-name.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )