शुरू करेंमुफ़्त में शुरू करें

अलग-अलग partitions के साथ IDs

आपने अभी एक DataFrame में ID फ़ील्ड जोड़ना पूरा किया है. अब देखें कि जब आप वही काम उन DataFrames पर करते हैं जिनमें partitions की संख्या अलग होती है, तो क्या होता है.

partitions की संख्या जाँचने के लिए, किसी DataFrame पर .rdd.getNumPartitions() मेथड का उपयोग करें.

आपके workspace में spark सेशन और दो DataFrames, voter_df और voter_df_single, उपलब्ध हैं. निर्देश आपको इन DataFrames के बीच के अंतर को समझने में मदद करेंगे. pyspark.sql.functions लाइब्रेरी F उपनाम के साथ उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • प्रत्येक DataFrame पर partitions की संख्या प्रिंट करें.
  • प्रत्येक DataFrame में एक ROW_ID फ़ील्ड जोड़ें.
  • प्रत्येक DataFrame में टॉप 10 IDs दिखाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
कोड संपादित करें और चलाएँ