or
यह अभ्यास पाठ्यक्रम का हिस्सा है
HTML की संरचना जानें। शुरुआत में हम समझाएँगे कि वेब स्क्रैपिंग आपके डेटा साइंस टूलबॉक्स में उपयोगी जोड़ क्यों है, और फिर HTML की कुछ बुनियादी बातें देखेंगी। अध्याय के अंत में हम XPath नोटेशन का छोटा परिचय देंगे, जिसका उपयोग HTML कोड के भीतर एलिमेंट्स को नेविगेट करने के लिए किया जाता है।
XPath सिंटैक्स का उपयोग करके scrapy selectors को एक्सप्लोर करें। ये दोनों अवधारणाएँ आपको एक HTML डॉक्यूमेंट को स्क्रैप करने के काबिल बनाती हैं।
वर्तमान अभ्यास
CSS Locator सिंटैक्स सीखें और XPath के साथ CSS Locators को चेन करने के विचार को आज़माना शुरू करें। हम Response ऑब्जेक्ट्स भी पेश करते हैं, जो Selectors की तरह काम करते हैं लेकिन हमें कई वेबसाइट्स पर अपनी स्क्रैपिंग को आगे बढ़ाने के लिए अतिरिक्त टूल देते हैं।
scrapy के साथ वेब क्रॉलर बनाना सीखें। ये scrapy स्पाइडर्स कई पेजों पर लिंक फॉलो करते हुए वेब को क्रॉल करेंगे, और पिछले अध्यायों में सीखी प्रक्रियाओं के अनुसार हर पेज को अपने-आप स्क्रैप करेंगे।