Trình thu thập dữ liệu tổng kết
Bài tập này là cơ hội để bạn thể hiện những gì mình đã học! Trong bài này, bạn sẽ viết hàm parse cho một spider rồi điền vài chỗ trống để hoàn thiện spider. Trên trang danh mục khóa học của DataCamp, mỗi khóa học được liệt kê có tiêu đề và mô tả ngắn. Spider này sẽ dùng để thu thập dữ liệu từ trang danh mục, trích xuất tiêu đề khóa học và phần mô tả ngắn. Lần này bạn không cần theo bất kỳ liên kết nào. Những gì bạn cần biết là:
- Tiêu đề khóa học nằm trong văn bản của phần tử
h4có class chứa chuỗiblock__title(gạch dưới kép). - Mô tả ngắn của khóa học nằm trong văn bản của phần tử đoạn văn
pcó class chứa chuỗiblock__description(gạch dưới kép).
Bài tập này là một phần của khóa học
Web Scraping với Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr