从 Start Requests 开始
在上一节课中,我们学习了如何在 scrapy 爬虫中设置 start_requests 方法。这里给出另一个简单示例的爬虫,它实际上不会抓取任何内容,但可以让您动手练习 start_requests 方法。我们的目标是让您开始熟悉在 start_requests 中传入 scrapy.Request 的各个参数。
与之前一样,我们已经创建了函数 inspect_class,用于检查您在 start_requests 中产出的内容。
本练习是课程的一部分
Python Web 爬取
练习说明
- 在
YourSpider类中补全创建scrapy爬虫所需的scrapy对象。 - 在
start_requests方法中产出的scrapy.Request调用里补全空白,使该爬虫开始抓取的 URL 为"https://www.datacamp.com",并使用parse方法(位于YourSpider类中)来解析网页。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )