Pająk – projekt końcowy
To ćwiczenie daje ci szansę, żeby pokazać, czego się nauczyłeś! Napiszesz funkcję parse dla pająka, a następnie uzupełnisz kilka luk, aby go ukończyć. Na stronie katalogu kursów DataCamp każdy kurs ma tytuł i krótki opis. Ten pająk posłuży do scrapowania katalogu kursów i wyodrębnienia tytułów oraz krótkich opisów. Tym razem nie będziesz śledzić żadnych linków. Oto wszystko, co musisz wiedzieć:
- Tytuły kursów to tekst zawarty w elemencie
h4, którego klasa zawiera ciągblock__title(podwójne podkreślenie). - Krótkie opisy kursów to tekst zawarty w elemencie akapitu
p, którego klasa zawiera ciągblock__description(podwójne podkreślenie).
To ćwiczenie jest częścią kursu
Web Scraping w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr