Починаємо зі Start Requests
У попередньому уроці ми розглянули налаштування методу start_requests у павуку scrapy. Тут маємо ще одного демонстраційного павука, який фактично нічого не збирає, але дає змогу попрактикуватися з методом start_requests. Нам важливо, щоб ви почали звикати до аргументів, які ви передаєте у виклик scrapy.Request всередині start_requests.
Як і раніше, ми створили функцію inspect_class, щоб перевірити, що саме ви повертаєте (yield) у start_requests.
Ця вправа є частиною курсу
Вебскрапінг у Python
Інструкції до вправи
- Заповніть потрібний об'єкт
scrapyу класіYourSpider, необхідний для створення павукаscrapy. - Заповніть пропуск у виклику
scrapy.Request, який повертається (yield) у методіstart_requests, так, щоб URL, з якого цей павук почне збирати дані, був"https://www.datacamp.com", і щоб для розбору вебсайту використовувався методparse(у класіYourSpider).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )