Начало работы с Start Requests
На прошлом уроке мы познакомились с настройкой метода start_requests в пауке scrapy. Здесь представлен ещё один упрощённый паук, который ничего не скрейпит по-настоящему, но даёт возможность поработать с методом start_requests. Ваша задача — освоиться с аргументами, которые передаются в вызов scrapy.Request внутри start_requests.
Как и прежде, мы создали функцию inspect_class, чтобы проверить, что именно вы возвращаете с помощью yield в start_requests.
Это упражнение является частью курса
Веб-скрапинг на Python
Инструкции к упражнению
- Добавьте необходимый объект
scrapyв классYourSpider, чтобы создать паукаscrapy. - Заполните пропуск в вызове
scrapy.Requestсyieldвнутри методаstart_requestsтак, чтобы паук начинал скрейпинг с URL"https://www.datacamp.com"и использовал методparse(из классаYourSpider) для обработки сайта.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )