ชื่อผู้เขียน
ในแบบฝึกหัดนี้ เราได้สร้าง spider class ไว้ให้แล้ว เมื่อเสร็จสมบูรณ์ spider นี้จะดึงชื่อผู้เขียนจากหน้าไดเรกทอรีคอร์สของ DataCamp เวอร์ชันย่อ โดย URL ของเวอร์ชันย่อนั้นเก็บอยู่ในตัวแปร url_short หน้าที่ของคุณคือสร้างรายการชื่อผู้เขียนที่ extract แล้วในเมธอด parse ของ spider
สิ่งที่ควรทราบ 2 ข้อ:
- จะใช้ออบเจกต์
responseและเมธอดcssในที่นี้ - ชื่อผู้เขียนคอร์สกำหนดจาก ข้อความ ภายใน element
pที่อยู่ใน classcourse-block__author-name
สามารถตรวจสอบ spider ได้โดยใช้ฟังก์ชัน inspect_spider() ที่เราสร้างไว้ให้ ซึ่งจะแสดงชื่อผู้เขียนที่ดึงมาได้
หมายเหตุ: แบบฝึกหัดนี้และแบบฝึกหัดที่เหลือในบทนี้อาจใช้เวลาโหลดสักครู่
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Web Scraping ด้วย Python
คำแนะนำการฝึกหัด
- ใส่อาร์กิวเมนต์ที่จำเป็นให้กับเมธอด parse เพื่อให้ทำงานได้อย่างถูกต้องเมื่อถูกเรียกใช้ในเมธอด
start_requests - ภายในเมธอด
parseให้ สร้าง ตัวแปรauthor_namesซึ่งเป็น list ของ string ที่ได้จากการ extract ข้อความออกจาก elementpที่อยู่ใน classcourse-block__author-name
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )