शुरू करेंमुफ़्त में शुरू करें

Parallelized collections से RDDs

Resilient Distributed Dataset (RDD) Spark में बेसिक abstraction है. यह ऑब्जेक्ट्स का एक immutable, distributed collection होता है. क्योंकि RDD Spark में एक बुनियादी और backbone डेटा टाइप है, इसका निर्माण कैसे किया जाता है यह समझना जरूरी है. इस अभ्यास में, आप शब्दों के एक कलेक्शन से PySpark में अपना पहला RDD बनाएँगे.

ध्यान रखें, आपके वर्कस्पेस में SparkContext sc पहले से उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • शब्दों की एक Python list से RDD नाम का एक RDD बनाएँ.
  • पुष्टि करें कि बनाया गया ऑब्जेक्ट RDD है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
कोड संपादित करें और चलाएँ