Parallelized collections से RDDs
Resilient Distributed Dataset (RDD) Spark में बेसिक abstraction है. यह ऑब्जेक्ट्स का एक immutable, distributed collection होता है. क्योंकि RDD Spark में एक बुनियादी और backbone डेटा टाइप है, इसका निर्माण कैसे किया जाता है यह समझना जरूरी है. इस अभ्यास में, आप शब्दों के एक कलेक्शन से PySpark में अपना पहला RDD बनाएँगे.
ध्यान रखें, आपके वर्कस्पेस में SparkContext sc पहले से उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
- शब्दों की एक Python list से
RDDनाम का एक RDD बनाएँ. - पुष्टि करें कि बनाया गया ऑब्जेक्ट RDD है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))