शुरू करेंमुफ़्त में शुरू करें

Missing Data को Impute करना

Missing data होना आम बात है। अगर हम मान लें कि हमारा डेटा पूरी तरह रैंडम तरीके से missing है, तो हम यह मान रहे हैं कि जो डेटा हमारे पास है, वह population का अच्छा प्रतिनिधित्व करता है। अगर कुछ वैल्यूज़ missing हों, तो हम उन्हें हटा सकते हैं या mean/median को रिप्लेसमेंट के रूप में इस्तेमाल कर सकते हैं। इस अभ्यास में, हम 'PDOM' को देखेंगे: Days on Market at Current Price.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • where(), isNull() और count() का उपयोग करके कॉलम 'PDOM' में missing वैल्यूज़ की गिनती निकालिए।
  • एग्रीगेट फंक्शन mean() का उपयोग करके 'PDOM' का mean वैल्यू निकालिए।
  • fillna() का उपयोग करें, वैल्यू को 'PDOM' के mean पर सेट करें, और केवल कॉलम 'PDOM' पर लागू करने के लिए subset पैरामीटर का उपयोग करें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
कोड संपादित करें और चलाएँ