or
यह अभ्यास पाठ्यक्रम का हिस्सा है
इस अध्याय में आप सीखेंगे कि Spark में एक SQL table कैसे बनाया और क्वेरी किया जाता है। Spark SQL, Spark में SQL की अभिव्यक्तिगत शक्ति लाता है। आप यह भी सीखेंगे कि Spark में SQL window functions का उपयोग कैसे करें। Window functions वर्तमान row से संबंधित rows पर कैलकुलेशन करते हैं। वे केवल joins और पारंपरिक aggregations का उपयोग करके मुश्किल लगने वाले परिणामों को काफी आसान बना देते हैं। हम window functions का उपयोग running sums, running differences, और अन्य ऐसे ऑपरेशंस के लिए करेंगे जो बेसिक SQL में चुनौतीपूर्ण होते हैं।
इस अध्याय में, आप natural language टेक्स्ट लोड करेंगे। फिर आप frequent word sequences खोजने के लिए moving window analysis लागू करेंगे।
पिछले अध्यायों में आपने window function SQL की अभिव्यक्तिगत शक्ति का उपयोग करना सीखा। अब, इसी वजह से यह समझना ज़रूरी है कि dataframes और SQL tables को सही तरीके से कैसे cache किया जाए। यह जानना भी महत्वपूर्ण है कि अपनी एप्लिकेशन का आकलन कैसे करें। आप यह काम Spark UI का उपयोग करके करना सीखेंगे। आप Spark में logging के लिए एक best practice भी सीखेंगे। Spark SQL क्वेरी परफॉर्मेंस ट्यूनिंग के लिए एक और उपयोगी टूल लाता है: query execution plan। आप सीखेंगे कि किसी dataframe की उत्पत्ति (provenance) का मूल्यांकन करने के लिए execution plan का उपयोग कैसे करें।
वर्तमान अभ्यास
पिछले अध्यायों ने आपको raw text लोड करने, उसे tokenize करने, और word sequences निकालने के टूल्स दिए। यह विश्लेषण के लिए तो उपयोगी है ही, मशीन लर्निंग के लिए भी उतना ही काम का है। अब तक जो आपने सीखा है, वह सब logistic regression का उपयोग करके टेक्स्ट को classify करने में एकसाथ आएगा। इस अध्याय के अंत तक, आप raw natural language टेक्स्ट डेटा लोड कर चुके होंगे और उसका उपयोग करके एक text classifier को train कर चुके होंगे।