डेटा को पुनः-पार्टिशन करना
एक dataframe text_df मौजूद है, जिसमें id, word, और chapter कॉलम हैं. text_df की पहली 5 पंक्तियाँ कंसोल पर प्रिंट की गई हैं.
आप निम्न कमांड से यह निर्धारित कर सकते हैं कि कुल 12 अध्याय हैं:
text_df.select('chapter')\
.distinct()\
.sort('chapter')\
.show(truncate=False)
इस कमांड का परिणाम कंसोल पर Table 1 के रूप में प्रिंट है.
फिलहाल text_df एक सिंगल पार्टिशन में है. मान लीजिए, आपको पता है कि अगले प्रोसेसिंग स्टेप्स में डेटा को chapters पर group किया जाएगा. प्रोसेसिंग सबसे कुशल तब होगी जब हर chapter एक ही मशीन के भीतर रहे. मशीनों के बीच अनावश्यक shuffling से बचने के लिए, आइए dataframe को प्रति chapter एक पार्टिशन में पुनः-पार्टिशन करें, इस chapter के पहले वीडियो लेसन में सिखाए गए repartition और getNumPartitions कमांड का उपयोग करते हुए.
यदि आपको याद न हो कि वीडियो में कोई स्टेप कैसे किया था, तो दाएँ तरफ उपलब्ध स्लाइड्स को देखने में हिचकिचाइए नहीं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Spark SQL परिचय
अभ्यास निर्देश
text_dfको 12 पार्टिशन में पुनः-पार्टिशन करें, ताकि प्रत्येक chapter अपने अलग पार्टिशन में हो.- नए dataframe में पार्टिशन की संख्या प्रदर्शित करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Repartition text_df into 12 partitions on 'chapter' column
repart_df = text_df.____(____, ____)
# Prove that repart_df has 12 partitions
repart_df.____.____