Začněte nyníZačněte zdarma

Capstone Crawler

Toto cvičení ti dává příležitost ukázat, co ses naučil/a! Napíšeš funkci parse pro spider a pak doplníš pár prázdných míst, abys ho dokončil/a. Na stránce s katalogem kurzů DataCampu má každý kurz nadpis a krátký popis. Tento spider bude sloužit ke scrapování katalogu a extrakci názvů kurzů a jejich krátkých popisů. Tentokrát nebudeš muset sledovat žádné odkazy. Vše, co potřebuješ vědět:

  • Názvy kurzů jsou definovány textem uvnitř elementu h4, jehož třída obsahuje řetězec block__title (dvojité podtržení).
  • Krátké popisy kurzů jsou definovány textem uvnitř odstavcového elementu p, jehož třída obsahuje řetězec block__description (dvojité podtržení).

Toto cvičení je součástí kurzu

Web Scraping v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
Upravit a spustit kód