开始使用免费开始使用

从 Start Requests 开始

在上一节课中,我们学习了如何在 scrapy 爬虫中设置 start_requests 方法。这里给出另一个简单示例的爬虫,它实际上不会抓取任何内容,但可以让您动手练习 start_requests 方法。我们的目标是让您开始熟悉在 start_requests 中传入 scrapy.Request 的各个参数。

与之前一样,我们已经创建了函数 inspect_class,用于检查您在 start_requests 中产出的内容。

本练习是课程的一部分

Python Web 爬取

查看课程

练习说明

  • YourSpider 类中补全创建 scrapy 爬虫所需的 scrapy 对象。
  • start_requests 方法中产出的 scrapy.Request 调用里补全空白,使该爬虫开始抓取的 URL 为 "https://www.datacamp.com",并使用 parse 方法(位于 YourSpider 类中)来解析网页。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( ____ ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( ____ )
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
编辑并运行代码