Primii pași cu Start Requests
În lecția anterioară am văzut cum se configurează metoda start_requests într-un spider scrapy. Aici avem un alt spider de probă care nu extrage efectiv date, dar îți oferă ocazia să explorezi metoda start_requests. Scopul este să te familiarizezi cu argumentele pe care le transmiți apelului scrapy.Request din interiorul metodei start_requests.
Ca și înainte, am creat funcția inspect_class pentru a examina ce produce metoda start_requests prin yield.
Acest exercițiu face parte din cursul
Web Scraping în Python
Instrucțiuni pentru exercițiu
- Completează obiectul
scrapynecesar în clasaYourSpiderpentru a crea spider-ulscrapy. - Completează spațiul liber din apelul
scrapy.Requestdin metodastart_requests, astfel încât URL-ul de la care ar începe spider-ul să fie"https://www.datacamp.com"și să folosească metodaparse(din clasaYourSpider) pentru a procesa pagina web.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )