Zacznij terazZacznij za darmo

Pająk – projekt końcowy

To ćwiczenie daje ci szansę, żeby pokazać, czego się nauczyłeś! Napiszesz funkcję parse dla pająka, a następnie uzupełnisz kilka luk, aby go ukończyć. Na stronie katalogu kursów DataCamp każdy kurs ma tytuł i krótki opis. Ten pająk posłuży do scrapowania katalogu kursów i wyodrębnienia tytułów oraz krótkich opisów. Tym razem nie będziesz śledzić żadnych linków. Oto wszystko, co musisz wiedzieć:

  • Tytuły kursów to tekst zawarty w elemencie h4, którego klasa zawiera ciąg block__title (podwójne podkreślenie).
  • Krótkie opisy kursów to tekst zawarty w elemencie akapitu p, którego klasa zawiera ciąg block__description (podwójne podkreślenie).

To ćwiczenie jest częścią kursu

Web Scraping w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
Edytuj i uruchom kod