開始使用免費開始

從 Start Requests 開始

在上一個單元中,我們學會了如何在 scrapy 蜘蛛中設定 start_requests 方法。這裡有另一個玩具範例的蜘蛛,它其實不會抓任何資料,但能讓你練習 start_requests 方法。我們的目的,是讓你開始熟悉在 start_requests 裡呼叫 scrapy.Request 時所傳入的引數。

和之前一樣,我們已建立 inspect_class 函式,用來檢查你在 start_requests 中產生(yield)的內容。

本練習屬於課程

Python 網頁爬蟲

檢視課程

練習說明

  • 在類別 YourSpider 中填入建立 scrapy 蜘蛛所需的 scrapy 物件。
  • start_requests 方法內的 scrapy.Request 呼叫中補上空白,使這個蜘蛛開始抓取的網址為 "https://www.datacamp.com",並使用 parse 方法(位於 YourSpider 類別中)來解析該網站。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
編輯並執行程式碼