Zacznij terazZacznij za darmo

Zaczynamy z metodą Start Requests

W poprzedniej lekcji poznaliśmy metodę start_requests w pająku scrapy. Tutaj masz do dyspozycji kolejny uproszczony pająk – nie wykonuje on żadnego scrapingu, ale daje ci szansę na zabawę z metodą start_requests. Chodzi o to, żebyś oswoił się z argumentami przekazywanymi do wywołania scrapy.Request wewnątrz start_requests.

Podobnie jak wcześniej, przygotowaliśmy funkcję inspect_class, która pozwala sprawdzić, co zwracasz w start_requests.

To ćwiczenie jest częścią kursu

Web Scraping w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Uzupełnij klasę YourSpider o wymagany obiekt scrapy potrzebny do utworzenia pająka.
  • Wypełnij lukę w wywołaniu scrapy.Request wewnątrz metody start_requests tak, aby pająk rozpoczynał scrapowanie od adresu "https://www.datacamp.com" i używał metody parse (zdefiniowanej w klasie YourSpider) do parsowania strony.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
Edytuj i uruchom kod