Bắt đầu với Start Requests
Trong bài trước, bạn đã học cách thiết lập phương thức start_requests trong một spider của scrapy. Dưới đây là một spider mô phỏng đơn giản, thực tế không thu thập dữ liệu nào, nhưng giúp bạn thực hành với phương thức start_requests. Mục tiêu là để bạn bắt đầu quen với các đối số truyền vào lệnh gọi scrapy.Request bên trong start_requests.
Như trước, chúng tôi đã tạo sẵn hàm inspect_class để kiểm tra những gì bạn đang yield trong start_requests.
Bài tập này là một phần của khóa học
Web Scraping với Python
Hướng dẫn bài tập
- Điền đối tượng
scrapycần thiết vào lớpYourSpiderđể tạo spiderscrapy. - Điền phần còn thiếu trong lệnh
scrapy.Requestđược yield trong phương thứcstart_requestssao cho URL mà spider này sẽ bắt đầu thu thập là"https://www.datacamp.com"và sử dụng phương thứcparse(thuộc lớpYourSpider) làm phương thức để phân tích trang web.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )