Итоговый паук-краулер
В этом упражнении вы сможете продемонстрировать всё, чему научились! Вам нужно написать функцию parse для паука, а затем заполнить несколько пропусков, чтобы завершить его настройку. На странице каталога курсов DataCamp каждый курс представлен названием и кратким описанием. Ваш паук будет извлекать эти данные с каталога. Переходить по ссылкам на этот раз не потребуется. Всё, что нужно знать:
- Названия курсов содержатся в тексте элемента
h4, класс которого включает строкуblock__title(двойное подчёркивание). - Краткие описания курсов содержатся в тексте элемента
p, класс которого включает строкуblock__description(двойное подчёркивание).
Это упражнение является частью курса
Веб-скрапинг на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr