or
यह अभ्यास पाठ्यक्रम का हिस्सा है
यह अध्याय Big Data की रोमांचक दुनिया का परिचय कराता है, साथ ही Big Data प्रोसेसिंग के लिए अलग-अलग कॉन्सेप्ट्स और फ्रेमवर्क्स भी समझाता है। आप समझेंगे कि Apache Spark को Big Data के लिए सर्वश्रेष्ठ फ्रेमवर्क क्यों माना जाता है।
Spark जो मुख्य abstraction प्रदान करता है वह है resilient distributed dataset (RDD), जो इस इंजन का मूल और रीढ़ की हड्डी जैसा डेटा टाइप है। यह अध्याय RDDs का परिचय देता है और दिखाता है कि RDD Transformations और Actions का उपयोग करके RDDs कैसे बनाए और चलाए जाते हैं।
इस अध्याय में, आप Spark SQL के बारे में सीखेंगे, जो structured data processing के लिए Spark का मॉड्यूल है। यह DataFrames नाम की एक प्रोग्रामिंग abstraction देता है और एक distributed SQL query engine की तरह भी काम कर सकता है। यह अध्याय दिखाता है कि Spark SQL आपको Python में DataFrames का उपयोग कैसे करने देता है।
PySpark MLlib, Apache Spark की scalable machine learning लाइब्रेरी है जो Python में सामान्य learning एल्गोरिदम्स और यूटिलिटीज़ प्रदान करती है। पूरे इस अंतिम अध्याय में, आप महत्वपूर्ण Machine Learning एल्गोरिदम्स सीखेंगे। आप एक मूवी रिकमेंडेशन इंजन और एक स्पैम फ़िल्टर बनाएँगे, और k-means क्लस्टरिंग का उपयोग करेंगे।
वर्तमान अभ्यास