笔名
在本练习中,我们已经为您搭建好了一个 spider 类。完成后,它会从精简版的 DataCamp 课程目录中抓取作者姓名。精简版的 URL 已保存在变量 url_short 中。您的任务是在 spider 的 parse 方法中创建提取出的作者姓名列表。
有两点需要知道:
- 您将使用
response对象及其css方法。 - 课程作者姓名由属于类
course-block__author-name的段落元素p中的文本定义。
您可以使用我们为您构建的函数 inspect_spider() 来检查该 spider——它会打印出您找到的作者姓名!
请注意:本章此题及后续练习可能需要一些时间加载。
本练习是课程的一部分
Python Web 爬取
练习说明
- 在
parse方法中补全所需参数,使其在start_requests方法调用时按要求工作。 - 在
parse方法内,创建变量author_names。它应是一个字符串列表,由从属于类course-block__author-name的段落元素中提取文本得到。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )