开始使用免费开始使用

抛出这些 URL

在下一课中,我们将讨论爬虫类中的 start_requests 方法。在这个小练习里,请您在 start_requests 方法中调整一个变量,这也为接下来的内容做个铺垫。简单来说,我们希望您开始熟悉在爬虫类里"转动一些齿轮";在这里,就是在 start_requests 方法中创建一个 urls 列表。

我们已经写好了一个函数 inspect_class,它会打印出您在 start_requests 方法里的 urls 变量所包含的元素列表。

注意:在接下来的几个练习中,您会编写代码来完善爬虫类,但这些代码暂时还不包含实际运行爬虫的部分;那会在最后实现。

本练习是课程的一部分

Python Web 爬取

查看课程

练习说明

  • start_requests 方法中填空,将变量 urls 赋值为一个包含两个字符串的列表:"https://www.datacamp.com""https://scrapy.org"

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( scrapy.Spider ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    urls = ____
    for url in urls:
      yield url
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
编辑并运行代码