Bắt đầu ngayBắt đầu miễn phí

Trình thu thập dữ liệu tổng kết

Bài tập này là cơ hội để bạn thể hiện những gì mình đã học! Trong bài này, bạn sẽ viết hàm parse cho một spider rồi điền vài chỗ trống để hoàn thiện spider. Trên trang danh mục khóa học của DataCamp, mỗi khóa học được liệt kê có tiêu đề và mô tả ngắn. Spider này sẽ dùng để thu thập dữ liệu từ trang danh mục, trích xuất tiêu đề khóa học và phần mô tả ngắn. Lần này bạn không cần theo bất kỳ liên kết nào. Những gì bạn cần biết là:

  • Tiêu đề khóa học nằm trong văn bản của phần tử h4 có class chứa chuỗi block__title (gạch dưới kép).
  • Mô tả ngắn của khóa học nằm trong văn bản của phần tử đoạn văn p có class chứa chuỗi block__description (gạch dưới kép).

Bài tập này là một phần của khóa học

Web Scraping với Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
Chỉnh sửa và Chạy Mã