Capstone Crawler
Toto cvičení ti dává příležitost ukázat, co ses naučil/a! Napíšeš funkci parse pro spider a pak doplníš pár prázdných míst, abys ho dokončil/a. Na stránce s katalogem kurzů DataCampu má každý kurz nadpis a krátký popis. Tento spider bude sloužit ke scrapování katalogu a extrakci názvů kurzů a jejich krátkých popisů. Tentokrát nebudeš muset sledovat žádné odkazy. Vše, co potřebuješ vědět:
- Názvy kurzů jsou definovány textem uvnitř elementu
h4, jehož třída obsahuje řetězecblock__title(dvojité podtržení). - Krátké popisy kurzů jsou definovány textem uvnitř odstavcového elementu
p, jehož třída obsahuje řetězecblock__description(dvojité podtržení).
Toto cvičení je součástí kurzu
Web Scraping v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr