期末爬蟲
這個練習讓你展現所學!你將為一個 spider 撰寫 parse 函式,然後再補上幾個空格,完成整個 spider。DataCamp 的課程目錄頁上,每個課程都有標題與簡短課程描述。這個 spider 會用來爬取課程目錄,擷取課程標題與簡短課程描述。這次不需要跟隨任何連結。你需要知道的是:
- 課程標題來自
h4元素內的文字,該元素的 class 含有字串block__title(雙底線)。 - 簡短課程描述來自段落
p元素內的文字,該元素的 class 含有字串block__description(雙底線)。
本練習屬於課程
Python 網頁爬蟲
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr