Псевдонимы авторов
В этом упражнении мы подготовили класс паука, который после доработки будет извлекать имена авторов из сокращённой версии каталога курсов DataCamp. URL сокращённой версии хранится в переменной url_short. Ваша задача — создать список извлечённых имён авторов в методе parse этого паука.
Обратите внимание на два важных момента:
- Здесь вы будете использовать объект
responseи методcss. - Имена авторов курсов определяются текстом внутри элементов абзаца
p, принадлежащих классуcourse-block__author-name.
Проверить работу паука можно с помощью функции inspect_spider(), которую мы подготовили заранее: она выведет найденные имена авторов.
Обратите внимание: загрузка этого и последующих упражнений главы может занять некоторое время.
Это упражнение является частью курса
Веб-скрапинг на Python
Инструкции к упражнению
- Укажите необходимые аргументы метода
parse, чтобы он корректно вызывался из методаstart_requests. - Внутри метода
parseсоздайте переменнуюauthor_names— список строк, полученных путём извлечения текста из элементов абзаца, принадлежащих классуcourse-block__author-name.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )