เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ระบุ URL เป้าหมาย

ในบทเรียนถัดไป เราจะพูดถึงเมธอด start_requests ภายใน spider class ในแบบฝึกหัดสั้น ๆ นี้ ให้ลองแก้ไขตัวแปรภายในเมธอด start_requests เพื่อเตรียมความพร้อมสำหรับสิ่งที่จะเรียนในบทถัดไป โดยพื้นฐานแล้ว เราต้องการให้คุณเริ่มคุ้นเคยกับการปรับแต่งส่วนต่าง ๆ ภายใน spider class ในกรณีนี้คือการสร้าง list ของ urls ภายในเมธอด start_requests

เราได้เขียนฟังก์ชัน inspect_class ไว้ให้แล้ว ซึ่งจะแสดงรายการสมาชิกทั้งหมดในตัวแปร urls ภายในเมธอด start_requests

หมายเหตุ: ในแบบฝึกหัดถัดไปอีกหลายข้อ คุณจะเขียนโค้ดเพื่อทำให้ spider class สมบูรณ์ แต่โค้ดยังไม่มีส่วนที่ใช้รันสไปเดอร์จริง ส่วนนั้นจะมาในตอนท้าย

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Web Scraping ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • เติมส่วนที่ว่างภายในเมธอด start_requests เพื่อกำหนดให้ตัวแปร urls เป็น list ที่มีสตริงสองรายการ ได้แก่ "https://www.datacamp.com" และ "https://scrapy.org"

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( scrapy.Spider ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    urls = ____
    for url in urls:
      yield url
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
แก้ไขและรันโค้ด