Ném các URL vào cuộc
Trong bài học tiếp theo, chúng ta sẽ nói về phương thức start_requests trong lớp spider. Ở bài tập nhanh này, bạn sẽ thay đổi một biến trong phương thức start_requests, như một bước dạo đầu cho những gì sẽ học ở bài sau. Nói ngắn gọn, bạn sẽ làm quen với việc “vặn vài nút” trong lớp spider; cụ thể ở đây là tạo một danh sách urls trong phương thức start_requests.
Chúng tôi đã viết sẵn hàm inspect_class để in ra danh sách các phần tử có trong biến urls bên trong phương thức start_requests của bạn.
Lưu ý: ở một vài bài tập tiếp theo, bạn sẽ viết mã để hoàn thiện lớp spider, nhưng hiện tại mã vẫn chưa có phần để thực sự chạy spider; phần đó sẽ xuất hiện ở cuối chương.
Bài tập này là một phần của khóa học
Web Scraping với Python
Hướng dẫn bài tập
- Điền vào chỗ trống trong phương thức
start_requestsđể gán biếnurlsmột danh sách gồm hai chuỗi:"https://www.datacamp.com"và"https://scrapy.org".
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( scrapy.Spider ):
name = "your_spider"
# start_requests method
def start_requests( self ):
urls = ____
for url in urls:
yield url
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )