เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Capstone Crawler

แบบฝึกหัดนี้เป็นโอกาสให้แสดงสิ่งที่เรียนรู้มา! ในแบบฝึกหัดนี้ คุณจะเขียนฟังก์ชัน parse ของ spider แล้วเติมข้อมูลในช่องว่างเพื่อให้ spider สมบูรณ์ ในหน้าไดเรกทอรีคอร์สของ DataCamp แต่ละคอร์สจะมีชื่อและคำอธิบายสั้น ๆ Spider นี้จะใช้ดึงข้อมูลจากหน้าไดเรกทอรีคอร์สเพื่อดึงชื่อคอร์สและคำอธิบายสั้น ๆ โดยไม่จำเป็นต้องติดตามลิงก์ใด ๆ ในครั้งนี้ ข้อมูลที่ต้องรู้มีดังนี้:

  • ชื่อคอร์สกำหนดโดยข้อความภายในองค์ประกอบ h4 ที่มี class ประกอบด้วยสตริง block__title (ขีดเส้นใต้คู่)
  • คำอธิบายคอร์สสั้น ๆ กำหนดโดยข้อความภายในองค์ประกอบย่อหน้า p ที่มี class ประกอบด้วยสตริง block__description (ขีดเส้นใต้คู่)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Web Scraping ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# parse method
def parse(self, response):
  # Extracted course titles
  crs_titles = response.xpath(____).extract()
  # Extracted course descriptions
  crs_descrs = response.xpath(____).extract()
  # Fill in the dictionary: it is the spider output
  for crs_title, crs_descr in zip(crs_titles, crs_descrs):
    dc_dict[crs_title] = crs_descr
แก้ไขและรันโค้ด