शुरू करेंमुफ़्त में शुरू करें

URLs को हर्ल करें

अगले लेसन में हम spider क्लास के भीतर start_requests मेथड के बारे में बात करेंगे। इस छोटे से अभ्यास में, हम आपसे start_requests मेथड के अंदर एक वैरिएबल को बदलने के लिए कह रहे हैं, जो अगले लेसन में सीखने वाली बातों की झलक देता है। मूल रूप से, हम चाहते हैं कि आप spider क्लास के कुछ पहियों को घुमाने में सहज होने लगें; इस केस में, start_requests मेथड के भीतर urls की एक list बनाना।

हमने एक फंक्शन inspect_class लिखा है, जो start_requests मेथड के भीतर urls वैरिएबल में मौजूद elements की list को प्रिंट करेगा।

नोट: अगले कुछ अभ्यासों में, आप अपने spider क्लास को पूरा करने के लिए कोड लिखेंगे, लेकिन कोड में अभी spider को वास्तव में run करने वाले हिस्से शामिल नहीं हैं; वह आख़िर में आएगा।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Web Scraping

पाठ्यक्रम देखें

अभ्यास निर्देश

  • start_requests मेथड के भीतर खाली जगह भरें ताकि वैरिएबल urls को इन दो strings वाली list असाइन हो: "https://www.datacamp.com" और "https://scrapy.org".

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import scrapy library
import scrapy

# Create the spider class
class YourSpider( scrapy.Spider ):
  name = "your_spider"
  # start_requests method
  def start_requests( self ):
    urls = ____
    for url in urls:
      yield url
  # parse method
  def parse( self, response ):
    pass
  
# Inspect Your Class
inspect_class( YourSpider )
कोड संपादित करें और चलाएँ