Spider Capstone
Acest exercițiu îți oferă ocazia să demonstrezi ce ai învățat! Vei scrie funcția parse pentru un spider și vei completa câteva spații libere pentru a finaliza spider-ul. Pe pagina directorului de cursuri DataCamp, fiecare curs listat are un titlu și o scurtă descriere. Acest spider va fi folosit pentru a extrage titlurile cursurilor și scurtele descrieri din directorul de cursuri. De data aceasta nu va trebui să urmărești niciun link. Iată tot ce trebuie să știi:
- Titlurile cursurilor sunt definite de textul dintr-un element
h4a cărui clasă conține șirulblock__title(cu dublu underscore). - Scurtele descrieri ale cursurilor sunt definite de textul dintr-un element paragraf
pa cărui clasă conține șirulblock__description(cu dublu underscore).
Acest exercițiu face parte din cursul
Web Scraping în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr