कैपस्टोन क्रॉलर
यह अभ्यास आपको अब तक सीखी हुई चीज़ें दिखाने का मौका देता है! इस अभ्यास में, आप एक स्पाइडर के लिए parse फंक्शन लिखेंगे और फिर कुछ खाली जगहें भरकर स्पाइडर को पूरा करेंगे। DataCamp के कोर्स डायरेक्टरी पेज पर, हर सूचीबद्ध कोर्स का एक टाइटल और एक छोटा कोर्स विवरण होता है। यह स्पाइडर कोर्स डायरेक्टरी को स्क्रैप करके कोर्स टाइटल और छोटे कोर्स विवरण निकालेगा। इस बार आपको किसी लिंक को फॉलो करने की ज़रूरत नहीं है। आपको बस ये बातें पता होनी चाहिए:
- कोर्स टाइटल उस
h4एलिमेंट के टेक्स्ट से परिभाषित हैं जिसकी class मेंblock__title(डबल अंडरस्कोर) स्ट्रिंग शामिल हो। - छोटे कोर्स विवरण उस पैराग्राफ
pएलिमेंट के टेक्स्ट से परिभाषित हैं जिसकी class मेंblock__description(डबल अंडरस्कोर) स्ट्रिंग शामिल हो।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Web Scraping
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# parse method
def parse(self, response):
# Extracted course titles
crs_titles = response.xpath(____).extract()
# Extracted course descriptions
crs_descrs = response.xpath(____).extract()
# Fill in the dictionary: it is the spider output
for crs_title, crs_descr in zip(crs_titles, crs_descrs):
dc_dict[crs_title] = crs_descr