Bút danh
Trong bài tập này, chúng tôi đã thiết lập một lớp spider mà khi hoàn thiện sẽ lấy tên tác giả từ phiên bản rút gọn của thư mục khóa học DataCamp. URL của phiên bản rút gọn được lưu trong biến url_short. Nhiệm vụ của bạn là tạo danh sách tên tác giả đã trích xuất trong phương thức parse của spider.
Có hai điều bạn cần biết:
- Bạn sẽ dùng đối tượng
responsevà phương thứccssở đây. - Tên tác giả khóa học được xác định bởi phần văn bản bên trong các phần tử đoạn văn
pthuộc classcourse-block__author-name
Bạn có thể kiểm tra spider bằng hàm inspect_spider() mà chúng tôi đã xây dựng sẵn — hàm này sẽ in ra các tên tác giả bạn tìm được!
Lưu ý rằng bài này và các bài tập còn lại trong chương có thể mất một chút thời gian để tải.
Bài tập này là một phần của khóa học
Web Scraping với Python
Hướng dẫn bài tập
- Điền các đối số cần thiết cho phương thức parse để nó hoạt động đúng khi được gọi trong phương thức
start_requests. - Bên trong phương thức
parse, tạo biếnauthor_names, là một danh sách chuỗi được tạo bằng cách trích xuất văn bản từ các phần tử đoạn văn thuộc classcourse-block__author-name.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )