抛出这些 URL
在下一课中,我们将讨论爬虫类中的 start_requests 方法。在这个小练习里,请您在 start_requests 方法中调整一个变量,这也为接下来的内容做个铺垫。简单来说,我们希望您开始熟悉在爬虫类里"转动一些齿轮";在这里,就是在 start_requests 方法中创建一个 urls 列表。
我们已经写好了一个函数 inspect_class,它会打印出您在 start_requests 方法里的 urls 变量所包含的元素列表。
注意:在接下来的几个练习中,您会编写代码来完善爬虫类,但这些代码暂时还不包含实际运行爬虫的部分;那会在最后实现。
本练习是课程的一部分
Python Web 爬取
练习说明
- 在
start_requests方法中填空,将变量urls赋值为一个包含两个字符串的列表:"https://www.datacamp.com"和"https://scrapy.org"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( scrapy.Spider ):
name = "your_spider"
# start_requests method
def start_requests( self ):
urls = ____
for url in urls:
yield url
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )