शुरू करेंमुफ़्त में शुरू करें

Missing Percent की गणना करें

डेटा साइंस का भविष्य ऑटोमेशन है। अगर आप डेटा प्रिपरेशन के कुछ हिस्सों को ऑटोमेट करना सीखते हैं, तो उसका बड़ा लाभ मिलता है। इस अभ्यास में, हम एक तय थ्रेशोल्ड से अधिक missing डेटा होने पर कॉलम्स को अपने-आप ड्रॉप करने की प्रक्रिया ऑटोमेट करेंगे।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक फंक्शन column_dropper() डिफाइन करें जो पैरामीटर्स df (एक डेटा फ़्रेम) और threshold (0 और 1 के बीच का float) लेता है.
  • where(), isNull() और count() का उपयोग करके missing वैल्यूज़ का प्रतिशत निकालें.
  • जाँचें कि missing का प्रतिशत थ्रेशोल्ड से अधिक है या नहीं; अगर हाँ, तो drop() का उपयोग करके उस कॉलम को ड्रॉप करें.
  • df पर column_dropper() चलाएँ और threshold को .6 पर सेट करें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def column_dropper(df, threshold):
  # Takes a dataframe and threshold for missing values. Returns a dataframe.
  total_records = df.____()
  for col in df.columns:
    # Calculate the percentage of missing values
    missing = df.____(df[col].____()).____()
    missing_percent = ____ / ____
    # Drop column if percent of missing is more than threshold
    if ____ > ____:
      df = df.____(col)
  return df

# Drop columns that are more than 60% missing
df = ____(____, ____)
कोड संपादित करें और चलाएँ