開始使用免費開始

期末爬蟲

這個練習讓你展現所學!你將為一個 spider 撰寫 parse 函式,然後再補上幾個空格,完成整個 spider。DataCamp 的課程目錄頁上,每個課程都有標題與簡短課程描述。這個 spider 會用來爬取課程目錄,擷取課程標題與簡短課程描述。這次不需要跟隨任何連結。你需要知道的是:

  • 課程標題來自 h4 元素內的文字,該元素的 class 含有字串 block__title(雙底線)。
  • 簡短課程描述來自段落 p 元素內的文字,該元素的 class 含有字串 block__description(雙底線)。

本練習屬於課程

Python 網頁爬蟲

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
編輯並執行程式碼