Pen Names
इस अभ्यास में, हमने आपके लिए एक spider क्लास सेटअप की है जो पूरा होने पर DataCamp कोर्स डायरेक्टरी के एक शॉर्ट किए गए वर्ज़न से लेखक के नाम निकालेगी. इस शॉर्ट वर्ज़न का URL वैरिएबल url_short में सेव है. आपका काम spider के parse मेथड में निकाले गए लेखक नामों की लिस्ट बनाना है.
दो बातें जो आपको पता होनी चाहिए:
- यहाँ आप
responseऑब्जेक्ट औरcssमेथड का उपयोग करेंगे. - कोर्स लेखक के नाम class
course-block__author-nameवाले पैराग्राफpएलिमेंट्स के अंदर के टेक्स्ट से परिभाषित हैं.
आप हमारे द्वारा बनाए गए फंक्शन inspect_spider() का उपयोग करके spider को inspect कर सकते हैं — यह आपके द्वारा पाए गए लेखक नाम प्रिंट करेगा!
ध्यान दें कि इस अध्याय के यह और आगे के अभ्यास लोड होने में कुछ समय ले सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Web Scraping
अभ्यास निर्देश
parseमेथड के लिए आवश्यक आर्ग्युमेंट्स भरें ताकिstart_requestsमेथड में कॉल होने पर यह अपेक्षित रूप से काम करे.parseमेथड के भीतर, एक वैरिएबलauthor_namesबनाएँ, जो strings की ऐसी लिस्ट हो जो classcourse-block__author-nameवाले पैराग्राफ एलिमेंट्स से टेक्स्ट extract करके बनाई गई हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the scrapy library
import scrapy
# Create the Spider class
class DCspider( scrapy.Spider ):
name = 'dcspider'
# start_requests method
def start_requests( self ):
yield scrapy.Request( url = url_short, callback = self.parse )
# parse method
def parse( ____ ):
# Create an extracted list of course author names
____
# Here we will just return the list of Authors
return author_names
# Inspect the spider
inspect_spider( DCspider )