शुरू करेंमुफ़्त में शुरू करें

Map और Collect

PySpark में डेटा को बदलने/प्रोसेस करने का मुख्य तरीका map() है. map() ट्रांसफॉर्मेशन एक फंक्शन लेता है और उसे RDD के हर एलिमेंट पर अप्लाई करता है. इसका उपयोग बहुत सारी चीजों के लिए किया जा सकता है, जैसे हमारी कलेक्शन में हर URL से जुड़ी वेबसाइट को फ़ेच करना या सिर्फ संख्याओं का वर्ग करना. इस सरल अभ्यास में, आप map() ट्रांसफॉर्मेशन का उपयोग करके पहले बनाए गए numbRDD RDD की हर संख्या का घन निकालेंगे. फिर, आप सभी एलिमेंट्स को एक वैरिएबल में स्टोर करेंगे और अंत में आउटपुट प्रिंट करेंगे.

ध्यान रखें, आपके वर्कस्पेस में SparkContext sc और numbRDD पहले से उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ऐसा map() ट्रांसफॉर्मेशन बनाएँ जो numbRDD की सभी संख्याओं का घन निकाल दे.
  • परिणामों को numbers_all वैरिएबल में कलेक्ट करें.
  • numbers_all वैरिएबल से आउटपुट प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)

# Collect the results
numbers_all = cubedRDD.____()

# Print the numbers from numbers_all
for numb in ____:
	print(____)
कोड संपादित करें और चलाएँ