เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ชื่อผู้เขียน

ในแบบฝึกหัดนี้ เราได้สร้าง spider class ไว้ให้แล้ว เมื่อเสร็จสมบูรณ์ spider นี้จะดึงชื่อผู้เขียนจากหน้าไดเรกทอรีคอร์สของ DataCamp เวอร์ชันย่อ โดย URL ของเวอร์ชันย่อนั้นเก็บอยู่ในตัวแปร url_short หน้าที่ของคุณคือสร้างรายการชื่อผู้เขียนที่ extract แล้วในเมธอด parse ของ spider

สิ่งที่ควรทราบ 2 ข้อ:

  • จะใช้ออบเจกต์ response และเมธอด css ในที่นี้
  • ชื่อผู้เขียนคอร์สกำหนดจาก ข้อความ ภายใน element p ที่อยู่ใน class course-block__author-name

สามารถตรวจสอบ spider ได้โดยใช้ฟังก์ชัน inspect_spider() ที่เราสร้างไว้ให้ ซึ่งจะแสดงชื่อผู้เขียนที่ดึงมาได้

หมายเหตุ: แบบฝึกหัดนี้และแบบฝึกหัดที่เหลือในบทนี้อาจใช้เวลาโหลดสักครู่

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Web Scraping ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใส่อาร์กิวเมนต์ที่จำเป็นให้กับเมธอด parse เพื่อให้ทำงานได้อย่างถูกต้องเมื่อถูกเรียกใช้ในเมธอด start_requests
  • ภายในเมธอด parse ให้ สร้าง ตัวแปร author_names ซึ่งเป็น list ของ string ที่ได้จากการ extract ข้อความออกจาก element p ที่อยู่ใน class course-block__author-name

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
แก้ไขและรันโค้ด