把 URLs 丟進來
在下一個單元,我們會介紹 spider 類別裡的 start_requests 方法。這個小練習要你在 start_requests 方法中動動手,調整一個變數,先預告一下我們接下來會學到的重點。基本上,我們希望你開始熟悉在 spider 類別裡「轉動一些齒輪」;這裡要做的是在 start_requests 方法中建立一個 urls 的清單。
我們已經寫好 inspect_class 函式,會將你在 start_requests 方法中 urls 變數所包含的元素清單列印出來。
注意:接下來幾個練習中,你會撰寫程式碼來完成你的 spider 類別,但這些程式碼尚未包含實際執行 spider 的部分;那會在最後再加入。
本練習屬於課程
Python 網頁爬蟲
練習說明
- 在
start_requests方法中填空,將變數urls指定為一個清單,裡面包含兩個字串:"https://www.datacamp.com"和"https://scrapy.org"。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( scrapy.Spider ):
name = "your_spider"
# start_requests method
def start_requests( self ):
urls = ____
for url in urls:
yield url
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )