Missing Percent की गणना करें
डेटा साइंस का भविष्य ऑटोमेशन है। अगर आप डेटा प्रिपरेशन के कुछ हिस्सों को ऑटोमेट करना सीखते हैं, तो उसका बड़ा लाभ मिलता है। इस अभ्यास में, हम एक तय थ्रेशोल्ड से अधिक missing डेटा होने पर कॉलम्स को अपने-आप ड्रॉप करने की प्रक्रिया ऑटोमेट करेंगे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
- एक फंक्शन
column_dropper()डिफाइन करें जो पैरामीटर्सdf(एक डेटा फ़्रेम) औरthreshold(0 और 1 के बीच का float) लेता है. where(),isNull()औरcount()का उपयोग करके missing वैल्यूज़ का प्रतिशत निकालें.- जाँचें कि missing का प्रतिशत थ्रेशोल्ड से अधिक है या नहीं; अगर हाँ, तो
drop()का उपयोग करके उस कॉलम को ड्रॉप करें. dfपरcolumn_dropper()चलाएँ और threshold को .6 पर सेट करें
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)