Začněte nyníZačněte zdarma

Začínáme s metodou Start Requests

V poslední lekci jsme se naučili, jak nastavit metodu start_requests uvnitř scrapy spideru. Tady máš další zjednodušený spider, který sice nic nescrapuje, ale dává ti příležitost si s metodou start_requests pohrát. Cílem je, abys začal/a být obeznámen/a s argumenty, které předáváš do volání scrapy.Request uvnitř start_requests.

Jako dříve, funkce inspect_class ti pomůže zkontrolovat, co metoda start_requests vrací pomocí yield.

Toto cvičení je součástí kurzu

Web Scraping v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Doplň do třídy YourSpider potřebný objekt scrapy, aby spider správně fungoval.
  • Vyplň chybějící část ve volání scrapy.Request uvnitř metody start_requests tak, aby spider začal scrapovat URL "https://www.datacamp.com" a jako metodu pro zpracování stránky použil parse (definovanou ve třídě YourSpider).

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
Upravit a spustit kód