शुरू करेंमुफ़्त में शुरू करें

Join के जरिए rows वैलिडेट करें

डेटा को फ़िल्टर करने का एक और तरीका है joins का उपयोग करके invalid entries को हटाना। आपको दिए गए valid_folders_df नामक DataFrame के आधार पर यह सत्यापित करना है कि फ़ोल्डर के नाम अपेक्षित हैं। DataFrame split_df वैसा ही है जैसा आपने छोड़ा था, जिसमें split कॉलम्स का एक समूह है।

spark ऑब्जेक्ट उपलब्ध है, और pyspark.sql.functions को F के रूप में इम्पोर्ट किया गया है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • valid_folders_df DataFrame में _c0 कॉलम का नाम बदलकर folder करें।
  • split_df में rows की संख्या गिनें।
  • दोनों DataFrame को फ़ोल्डर नाम पर join करें, और परिणामस्वरूप बने DataFrame को joined_df कहें। सुनिश्चित करें कि छोटे DataFrame को broadcast करें।
  • DataFrame में बची rows की संख्या जाँचें और तुलना करें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
कोड संपादित करें और चलाएँ