शुरू करेंमुफ़्त में शुरू करें

DataFrames का उपयोग

Spark की कोर डेटा स्ट्रक्चर Resilient Distributed Dataset (RDD) है. यह एक लो-लेवल ऑब्जेक्ट है जो डेटा को क्लस्टर के कई नोड्स में बाँटकर Spark को तेज़ी से काम करने देता है. लेकिन RDDs के साथ सीधे काम करना कठिन होता है, इसलिए इस कोर्स में आप RDDs के ऊपर बनी Spark DataFrame एब्स्ट्रैक्शन का उपयोग करेंगे.

Spark DataFrame को इस तरह डिज़ाइन किया गया है कि यह SQL टेबल जैसा व्यवहार करे (कॉलम्स में वैरिएबल्स और रोज़ में ऑब्ज़र्वेशंस वाली टेबल). समझने में आसान होने के साथ-साथ, DataFrames जटिल ऑपरेशंस के लिए RDDs की तुलना में अधिक ऑप्टिमाइज़्ड भी होते हैं.

जब आप डेटा की कॉलम्स और रोज़ को संशोधित और संयोजित करना शुरू करते हैं, तो एक ही नतीजे तक पहुँचने के कई तरीके हो सकते हैं, लेकिन कुछ तरीकों में काफी अधिक समय लगता है. RDDs का उपयोग करते समय क्वेरी को कैसे ऑप्टिमाइज़ करना है, यह डेटा साइंटिस्ट पर निर्भर होता है, जबकि DataFrame इम्प्लीमेंटेशन में इस ऑप्टिमाइज़ेशन का बड़ा हिस्सा पहले से ही बिल्ट-इन होता है!

Spark DataFrames के साथ काम शुरू करने के लिए, आपको अपने SparkContext से एक SparkSession ऑब्जेक्ट बनाना होगा. आप SparkContext को क्लस्टर से अपने कनेक्शन के रूप में और SparkSession को उस कनेक्शन के साथ आपका इंटरफेस मान सकते हैं.

याद रखें, इस पूरे कोर्स में आपके वर्कस्पेस में spark नाम का एक SparkSession उपलब्ध रहेगा!

निम्न में से कौन-सा लाभ Spark DataFrames को RDDs पर मिलता है?

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें