НачатьНачать бесплатно

Псевдонимы авторов

В этом упражнении мы подготовили класс паука, который после доработки будет извлекать имена авторов из сокращённой версии каталога курсов DataCamp. URL сокращённой версии хранится в переменной url_short. Ваша задача — создать список извлечённых имён авторов в методе parse этого паука.

Обратите внимание на два важных момента:

  • Здесь вы будете использовать объект response и метод css.
  • Имена авторов курсов определяются текстом внутри элементов абзаца p, принадлежащих классу course-block__author-name.

Проверить работу паука можно с помощью функции inspect_spider(), которую мы подготовили заранее: она выведет найденные имена авторов.

Обратите внимание: загрузка этого и последующих упражнений главы может занять некоторое время.

Это упражнение является частью курса

Веб-скрапинг на Python

Посмотреть курс

Инструкции к упражнению

  • Укажите необходимые аргументы метода parse, чтобы он корректно вызывался из метода start_requests.
  • Внутри метода parse создайте переменную author_names — список строк, полученных путём извлечения текста из элементов абзаца, принадлежащих классу course-block__author-name.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
Редактировать и запускать код