Capstone Crawler
แบบฝึกหัดนี้เป็นโอกาสให้แสดงสิ่งที่เรียนรู้มา! ในแบบฝึกหัดนี้ คุณจะเขียนฟังก์ชัน parse ของ spider แล้วเติมข้อมูลในช่องว่างเพื่อให้ spider สมบูรณ์ ในหน้าไดเรกทอรีคอร์สของ DataCamp แต่ละคอร์สจะมีชื่อและคำอธิบายสั้น ๆ Spider นี้จะใช้ดึงข้อมูลจากหน้าไดเรกทอรีคอร์สเพื่อดึงชื่อคอร์สและคำอธิบายสั้น ๆ โดยไม่จำเป็นต้องติดตามลิงก์ใด ๆ ในครั้งนี้ ข้อมูลที่ต้องรู้มีดังนี้:
- ชื่อคอร์สกำหนดโดยข้อความภายในองค์ประกอบ
h4ที่มี class ประกอบด้วยสตริงblock__title(ขีดเส้นใต้คู่) - คำอธิบายคอร์สสั้น ๆ กำหนดโดยข้อความภายในองค์ประกอบย่อหน้า
pที่มี class ประกอบด้วยสตริงblock__description(ขีดเส้นใต้คู่)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Web Scraping ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr