시작하기무료로 시작하기

캡스톤 크롤러

이 연습 문제는 지금까지 배운 내용을 마음껏 보여 주는 자리예요! 이 문제에서는 스파이더의 parse 함수를 작성하고, 이어서 몇 가지 빈칸을 채워 스파이더를 완성하겠습니다. DataCamp의 강의 디렉터리 페이지에서 각 강의에는 제목과 짧은 강의 설명이 있습니다. 이 스파이더는 강의 디렉터리를 스크레이핑하여 강의 제목과 짧은 강의 설명을 추출하는 데 사용돼요. 이번에는 링크를 따라갈 필요가 없습니다. 알아두셔야 할 것은 다음과 같습니다:

  • 강의 제목은 클래스에 문자열 block__title(밑줄 두 개)이 포함된 h4 요소 내부의 텍스트로 정의됩니다.
  • 짧은 강의 설명은 클래스에 문자열 block__description(밑줄 두 개)이 포함된 문단 p 요소 내부의 텍스트로 정의됩니다.

이 연습은 강의의 일부입니다

Python으로 하는 웹 스크레이핑

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
코드 편집 및 실행