Zaczynamy z metodą Start Requests
W poprzedniej lekcji poznaliśmy metodę start_requests w pająku scrapy. Tutaj masz do dyspozycji kolejny uproszczony pająk – nie wykonuje on żadnego scrapingu, ale daje ci szansę na zabawę z metodą start_requests. Chodzi o to, żebyś oswoił się z argumentami przekazywanymi do wywołania scrapy.Request wewnątrz start_requests.
Podobnie jak wcześniej, przygotowaliśmy funkcję inspect_class, która pozwala sprawdzić, co zwracasz w start_requests.
To ćwiczenie jest częścią kursu
Web Scraping w Pythonie
Instrukcje do ćwiczenia
- Uzupełnij klasę
YourSpidero wymagany obiektscrapypotrzebny do utworzenia pająka. - Wypełnij lukę w wywołaniu
scrapy.Requestwewnątrz metodystart_requeststak, aby pająk rozpoczynał scrapowanie od adresu"https://www.datacamp.com"i używał metodyparse(zdefiniowanej w klasieYourSpider) do parsowania strony.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )