НачатьНачать бесплатно

Начало работы с Start Requests

На прошлом уроке мы познакомились с настройкой метода start_requests в пауке scrapy. Здесь представлен ещё один упрощённый паук, который ничего не скрейпит по-настоящему, но даёт возможность поработать с методом start_requests. Ваша задача — освоиться с аргументами, которые передаются в вызов scrapy.Request внутри start_requests.

Как и прежде, мы создали функцию inspect_class, чтобы проверить, что именно вы возвращаете с помощью yield в start_requests.

Это упражнение является частью курса

Веб-скрапинг на Python

Посмотреть курс

Инструкции к упражнению

  • Добавьте необходимый объект scrapy в класс YourSpider, чтобы создать паука scrapy.
  • Заполните пропуск в вызове scrapy.Request с yield внутри метода start_requests так, чтобы паук начинал скрейпинг с URL "https://www.datacamp.com" и использовал метод parse (из класса YourSpider) для обработки сайта.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
Редактировать и запускать код