शुरू करेंमुफ़्त में शुरू करें

5000 पॉइंट्स डेटा लोड करना और पार्स करना

क्लस्टरिंग एक अनसुपरवाइज्ड लर्निंग टास्क है जिसमें मिलते-जुलते ऑब्जेक्ट्स को उच्च समानता वाले समूहों (clusters) में बाँटा जाता है। सुपरवाइज्ड टास्क के विपरीत, जहाँ डेटा लेबल्ड होता है, क्लस्टरिंग का उपयोग अनलेबल्ड डेटा को समझने में किया जा सकता है। PySpark MLlib क्लस्टरिंग के लिए लोकप्रिय K-means एल्गोरिदम शामिल करता है। इस 3-भाग के अभ्यास में, आप 5000 पंक्तियों और 2 कॉलम वाले डेटासेट में कितने क्लस्टर्स हैं, यह पता लगाएंगे। इसके लिए आप पहले डेटा को एक RDD में लोड करेंगे, डिलिमिटर के आधार पर RDD को पार्स करेंगे, KMeans मॉडल चलाएँगे, मॉडल का मूल्यांकन करेंगे, और अंत में क्लस्टर्स को विजुअलाइज़ करेंगे.

पहले भाग में, आप डेटा को RDD में लोड करेंगे, डिलिमिटर के आधार पर RDD को पार्स करेंगे, और डेटा के string टाइप को integer में बदलेंगे.

ध्यान रखें, आपके वर्कस्पेस में SparkContext sc उपलब्ध है। साथ ही file_path वैरिएबल (जो 5000_points.txt फाइल का पाथ है) भी आपके वर्कस्पेस में पहले से उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • 5000_points डेटासेट को clusterRDD नामक RDD में लोड करें.
  • टैब ("\t") के आधार पर लाइनों को स्प्लिट करके clusterRDD को ट्रांसफॉर्म करें.
  • स्प्लिट किए गए RDD को ट्रांसफॉर्म करके दोनों कॉलम के लिए इंटीजर की लिस्ट बनाएँ.
  • यह कन्फर्म करें कि डेटासेट में 5000 पंक्तियाँ हैं.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the dataset into an RDD
clusterRDD = sc.____(file_path)

# Split the RDD based on tab
rdd_split = clusterRDD.____(lambda x: ____.split(____))

# Transform the split RDD by creating a list of integers
rdd_split_int = rdd_split.____(lambda x: [int(____), int(x[1])])

# Count the number of rows in RDD 
print("There are {} rows in the rdd_split_int dataset".format(____.____()))
कोड संपादित करें और चलाएँ