ÎncepețiÎncepe gratuit

Pseudonime

În acest exercițiu, am pregătit o clasă spider care, odată finalizată, va prelua numele autorilor dintr-o versiune prescurtată a directorului de cursuri DataCamp. URL-ul pentru versiunea prescurtată este stocat în variabila url_short. Sarcina ta este să creezi lista de nume de autori extrase în metoda parse a spider-ului.

Două lucruri de reținut:

  • Vei folosi obiectul response și metoda css.
  • Numele autorilor de cursuri sunt definite de textul din elementele de tip paragraf p aparținând clasei course-block__author-name

Poți inspecta spider-ul folosind funcția inspect_spider() pe care am construit-o pentru tine -- va afișa numele autorilor găsite!

Reține că acest exercițiu și cele rămase din capitol pot dura ceva timp să se încarce.

Acest exercițiu face parte din cursul

Web Scraping în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează argumentele necesare metodei parse, astfel încât să funcționeze corect când este apelată în metoda start_requests.
  • În interiorul metodei parse, creează o variabilă author_names, care este o listă de șiruri obținută prin extragerea textului din elementele de tip paragraf aparținând clasei course-block__author-name.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
Editează și rulează codul