Join के जरिए rows वैलिडेट करें
डेटा को फ़िल्टर करने का एक और तरीका है joins का उपयोग करके invalid entries को हटाना। आपको दिए गए valid_folders_df नामक DataFrame के आधार पर यह सत्यापित करना है कि फ़ोल्डर के नाम अपेक्षित हैं। DataFrame split_df वैसा ही है जैसा आपने छोड़ा था, जिसमें split कॉलम्स का एक समूह है।
spark ऑब्जेक्ट उपलब्ध है, और pyspark.sql.functions को F के रूप में इम्पोर्ट किया गया है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
valid_folders_dfDataFrame में_c0कॉलम का नाम बदलकरfolderकरें।split_dfमें rows की संख्या गिनें।- दोनों DataFrame को फ़ोल्डर नाम पर join करें, और परिणामस्वरूप बने DataFrame को
joined_dfकहें। सुनिश्चित करें कि छोटे DataFrame को broadcast करें। - DataFrame में बची rows की संख्या जाँचें और तुलना करें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))