始める無料で始める

Start Requests から始める

前のレッスンでは、scrapy スパイダー内で start_requests メソッドを設定する方法を学びました。ここでは、実際には何もスクレイピングしないお試し用のスパイダーを使いますが、start_requests メソッドを練習できます。目的は、start_requests 内で scrapy.Request を呼び出す際に渡す引数に慣れていただくことです。

これまでと同様に、start_requests で yield している内容を確認するための関数 inspect_class を用意しています。

この演習はコースの一部です

Pythonで学ぶWebスクレイピング

コースを見る

演習の手順

  • scrapy スパイダーを作成するために必要な scrapy のオブジェクトを、クラス YourSpider に記入してください。
  • start_requests メソッド内で yield する scrapy.Request 呼び出しの空欄を埋め、スパイダーがスクレイピングを開始する URL を "https://www.datacamp.com" にし、ウェブサイトの解析には(YourSpider クラス内の)parse メソッドを使うようにしてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
コードを編集して実行