ÎncepețiÎncepe gratuit

Primii pași cu Start Requests

În lecția anterioară am văzut cum se configurează metoda start_requests într-un spider scrapy. Aici avem un alt spider de probă care nu extrage efectiv date, dar îți oferă ocazia să explorezi metoda start_requests. Scopul este să te familiarizezi cu argumentele pe care le transmiți apelului scrapy.Request din interiorul metodei start_requests.

Ca și înainte, am creat funcția inspect_class pentru a examina ce produce metoda start_requests prin yield.

Acest exercițiu face parte din cursul

Web Scraping în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează obiectul scrapy necesar în clasa YourSpider pentru a crea spider-ul scrapy.
  • Completează spațiul liber din apelul scrapy.Request din metoda start_requests, astfel încât URL-ul de la care ar începe spider-ul să fie "https://www.datacamp.com" și să folosească metoda parse (din clasa YourSpider) pentru a procesa pagina web.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
Editează și rulează codul