ระบุ URL เป้าหมาย
ในบทเรียนถัดไป เราจะพูดถึงเมธอด start_requests ภายใน spider class ในแบบฝึกหัดสั้น ๆ นี้ ให้ลองแก้ไขตัวแปรภายในเมธอด start_requests เพื่อเตรียมความพร้อมสำหรับสิ่งที่จะเรียนในบทถัดไป โดยพื้นฐานแล้ว เราต้องการให้คุณเริ่มคุ้นเคยกับการปรับแต่งส่วนต่าง ๆ ภายใน spider class ในกรณีนี้คือการสร้าง list ของ urls ภายในเมธอด start_requests
เราได้เขียนฟังก์ชัน inspect_class ไว้ให้แล้ว ซึ่งจะแสดงรายการสมาชิกทั้งหมดในตัวแปร urls ภายในเมธอด start_requests
หมายเหตุ: ในแบบฝึกหัดถัดไปอีกหลายข้อ คุณจะเขียนโค้ดเพื่อทำให้ spider class สมบูรณ์ แต่โค้ดยังไม่มีส่วนที่ใช้รันสไปเดอร์จริง ส่วนนั้นจะมาในตอนท้าย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Web Scraping ด้วย Python
คำแนะนำการฝึกหัด
- เติมส่วนที่ว่างภายในเมธอด
start_requestsเพื่อกำหนดให้ตัวแปรurlsเป็น list ที่มีสตริงสองรายการ ได้แก่"https://www.datacamp.com"และ"https://scrapy.org"
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( scrapy.Spider ):
name = "your_spider"
# start_requests method
def start_requests( self ):
urls = ____
for url in urls:
yield url
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )