Start Requests から始める
前のレッスンでは、scrapy スパイダー内で start_requests メソッドを設定する方法を学びました。ここでは、実際には何もスクレイピングしないお試し用のスパイダーを使いますが、start_requests メソッドを練習できます。目的は、start_requests 内で scrapy.Request を呼び出す際に渡す引数に慣れていただくことです。
これまでと同様に、start_requests で yield している内容を確認するための関数 inspect_class を用意しています。
この演習はコースの一部です
Pythonで学ぶWebスクレイピング
演習の手順
scrapyスパイダーを作成するために必要なscrapyのオブジェクトを、クラスYourSpiderに記入してください。start_requestsメソッド内で yield するscrapy.Request呼び出しの空欄を埋め、スパイダーがスクレイピングを開始する URL を"https://www.datacamp.com"にし、ウェブサイトの解析には(YourSpiderクラス内の)parseメソッドを使うようにしてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )