शुरू करेंमुफ़्त में शुरू करें

Pen Names

इस अभ्यास में, हमने आपके लिए एक spider क्लास सेटअप की है जो पूरा होने पर DataCamp कोर्स डायरेक्टरी के एक शॉर्ट किए गए वर्ज़न से लेखक के नाम निकालेगी. इस शॉर्ट वर्ज़न का URL वैरिएबल url_short में सेव है. आपका काम spider के parse मेथड में निकाले गए लेखक नामों की लिस्ट बनाना है.

दो बातें जो आपको पता होनी चाहिए:

  • यहाँ आप response ऑब्जेक्ट और css मेथड का उपयोग करेंगे.
  • कोर्स लेखक के नाम class course-block__author-name वाले पैराग्राफ p एलिमेंट्स के अंदर के टेक्स्ट से परिभाषित हैं.

आप हमारे द्वारा बनाए गए फंक्शन inspect_spider() का उपयोग करके spider को inspect कर सकते हैं — यह आपके द्वारा पाए गए लेखक नाम प्रिंट करेगा!

ध्यान दें कि इस अध्याय के यह और आगे के अभ्यास लोड होने में कुछ समय ले सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Web Scraping

पाठ्यक्रम देखें

अभ्यास निर्देश

  • parse मेथड के लिए आवश्यक आर्ग्युमेंट्स भरें ताकि start_requests मेथड में कॉल होने पर यह अपेक्षित रूप से काम करे.
  • parse मेथड के भीतर, एक वैरिएबल author_names बनाएँ, जो strings की ऐसी लिस्ट हो जो class course-block__author-name वाले पैराग्राफ एलिमेंट्स से टेक्स्ट extract करके बनाई गई हो.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the scrapy library
import scrapy

# Create the Spider class
class DCspider( scrapy.Spider ):
  name = 'dcspider'
  # start_requests method
  def start_requests( self ):
    yield scrapy.Request( url = url_short, callback = self.parse )
  # parse method
  def parse( ____ ):
    # Create an extracted list of course author names
    ____
    # Here we will just return the list of Authors
    return author_names
  
# Inspect the spider
inspect_spider( DCspider )
कोड संपादित करें और चलाएँ