เริ่มต้นด้วย Start Requests
ในบทที่แล้วเราได้เรียนรู้การตั้งค่าเมธอด start_requests ภายใน spider ของ scrapy ที่นี่เรามี spider ตัวอย่างอีกตัวซึ่งไม่ได้ดึงข้อมูลจริง แต่ช่วยให้ได้ฝึกใช้เมธอด start_requests สิ่งที่ต้องการคือให้คุ้นเคยกับอาร์กิวเมนต์ที่ส่งเข้าไปใน scrapy.Request ภายใน start_requests
เช่นเดิม เราได้สร้างฟังก์ชัน inspect_class ไว้สำหรับตรวจสอบสิ่งที่ yield ออกมาใน start_requests
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Web Scraping ด้วย Python
คำแนะนำการฝึกหัด
- เติม object ของ
scrapyที่จำเป็นลงในคลาสYourSpiderเพื่อสร้าง spider ของscrapy - เติมช่องว่างในคำสั่ง
scrapy.Requestที่ถูก yield ภายในเมธอดstart_requestsเพื่อให้ spider เริ่มดึงข้อมูลจาก"https://www.datacamp.com"และใช้เมธอดparse(ภายในคลาสYourSpider) เป็นเมธอดสำหรับแปลงข้อมูลจากเว็บไซต์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( ____ ):
name = "your_spider"
# start_requests method
def start_requests( self ):
yield scrapy.Request( ____ )
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )