Začněte nyníZačněte zdarma

Zadej URL adresy

V další lekci si povíme o metodě start_requests ve třídě spideru. V tomto krátkém cvičení tě požádáme o změnu jedné proměnné v metodě start_requests – tím se trochu předběhneme k tomu, co nás čeká dál. Chceme, abys začal/a být v pohodě s tím, jak se ve třídě spideru pohybovat; konkrétně teď půjde o vytvoření seznamu urls v metodě start_requests.

Napsali jsme funkci inspect_class, která vypíše seznam prvků, které máš v proměnné urls v metodě start_requests.

Poznámka: V několika následujících cvičeních budeš psát kód k dokončení své třídy spideru, ale kód zatím neobsahuje části potřebné ke skutečnému spuštění spideru – to přijde na konci.

Toto cvičení je součástí kurzu

Web Scraping v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Doplň prázdné místo v metodě start_requests tak, aby proměnná urls obsahovala seznam se dvěma řetězci: "https://www.datacamp.com" a "https://scrapy.org".

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( scrapy.Spider ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    urls = ____
    for url in urls:
      yield url
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
Upravit a spustit kód