शुरू करेंमुफ़्त में शुरू करें

अमान्य पंक्तियों की जाँच

आपने join का उपयोग करके पंक्तियों को सफलतापूर्वक फ़िल्टर कर लिया है, लेकिन कभी-कभी आप अमान्य डेटा को देखना चाहेंगे. इस डेटा को आगे की प्रोसेसिंग के लिए या अपने डेटा सोर्सेज़ की ट्रबलशूटिंग के लिए सहेजा जा सकता है.

आप दो DataFrames के बीच का अंतर खोजना चाहते हैं और अमान्य पंक्तियों को स्टोर करना चाहते हैं.

spark ऑब्जेक्ट परिभाषित है और pyspark.sql.functions को F के नाम से इम्पोर्ट किया गया है. मूल DataFrame split_df और joined DataFrame joined_df अपनी पिछली अवस्थाओं के रूप में उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • प्रत्येक DataFrame के लिए row counts निर्धारित करें.
  • केवल अमान्य पंक्तियों वाला एक DataFrame बनाएँ.
  • नए DataFrame की count अपेक्षा के अनुरूप है, यह वैलिडेट करें.
  • हटाई गई distinct folder पंक्तियों की संख्या निर्धारित करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
कोड संपादित करें और चलाएँ