Začínáme s metodou Start Requests
V poslední lekci jsme se naučili, jak nastavit metodu start_requests uvnitř scrapy spideru. Tady máš další zjednodušený spider, který sice nic nescrapuje, ale dává ti příležitost si s metodou start_requests pohrát. Cílem je, abys začal/a být obeznámen/a s argumenty, které předáváš do volání scrapy.Request uvnitř start_requests.
Jako dříve, funkce inspect_class ti pomůže zkontrolovat, co metoda start_requests vrací pomocí yield.
Toto cvičení je součástí kurzu
Web Scraping v Pythonu
Pokyny k cvičení
- Doplň do třídy
YourSpiderpotřebný objektscrapy, aby spider správně fungoval. - Vyplň chybějící část ve volání
scrapy.Requestuvnitř metodystart_requeststak, aby spider začal scrapovat URL"https://www.datacamp.com"a jako metodu pro zpracování stránky použilparse(definovanou ve tříděYourSpider).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )