從 Start Requests 開始
在上一個單元中,我們學會了如何在 scrapy 蜘蛛中設定 start_requests 方法。這裡有另一個玩具範例的蜘蛛,它其實不會抓任何資料,但能讓你練習 start_requests 方法。我們的目的,是讓你開始熟悉在 start_requests 裡呼叫 scrapy.Request 時所傳入的引數。
和之前一樣,我們已建立 inspect_class 函式,用來檢查你在 start_requests 中產生(yield)的內容。
本練習屬於課程
Python 網頁爬蟲
練習說明
- 在類別
YourSpider中填入建立scrapy蜘蛛所需的scrapy物件。 - 在
start_requests方法內的scrapy.Request呼叫中補上空白,使這個蜘蛛開始抓取的網址為"https://www.datacamp.com",並使用parse方法(位於YourSpider類別中)來解析該網站。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )