URLs को हर्ल करें
अगले लेसन में हम spider क्लास के भीतर start_requests मेथड के बारे में बात करेंगे। इस छोटे से अभ्यास में, हम आपसे start_requests मेथड के अंदर एक वैरिएबल को बदलने के लिए कह रहे हैं, जो अगले लेसन में सीखने वाली बातों की झलक देता है। मूल रूप से, हम चाहते हैं कि आप spider क्लास के कुछ पहियों को घुमाने में सहज होने लगें; इस केस में, start_requests मेथड के भीतर urls की एक list बनाना।
हमने एक फंक्शन inspect_class लिखा है, जो start_requests मेथड के भीतर urls वैरिएबल में मौजूद elements की list को प्रिंट करेगा।
नोट: अगले कुछ अभ्यासों में, आप अपने spider क्लास को पूरा करने के लिए कोड लिखेंगे, लेकिन कोड में अभी spider को वास्तव में run करने वाले हिस्से शामिल नहीं हैं; वह आख़िर में आएगा।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Web Scraping
अभ्यास निर्देश
start_requestsमेथड के भीतर खाली जगह भरें ताकि वैरिएबलurlsको इन दो strings वाली list असाइन हो:"https://www.datacamp.com"और"https://scrapy.org".
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import scrapy library
import scrapy
# Create the spider class
class YourSpider( scrapy.Spider ):
name = "your_spider"
# start_requests method
def start_requests( self ):
urls = ____
for url in urls:
yield url
# parse method
def parse( self, response ):
pass
# Inspect Your Class
inspect_class( YourSpider )