Missing Data को Impute करना
Missing data होना आम बात है। अगर हम मान लें कि हमारा डेटा पूरी तरह रैंडम तरीके से missing है, तो हम यह मान रहे हैं कि जो डेटा हमारे पास है, वह population का अच्छा प्रतिनिधित्व करता है। अगर कुछ वैल्यूज़ missing हों, तो हम उन्हें हटा सकते हैं या mean/median को रिप्लेसमेंट के रूप में इस्तेमाल कर सकते हैं। इस अभ्यास में, हम 'PDOM' को देखेंगे: Days on Market at Current Price.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
where(),isNull()औरcount()का उपयोग करके कॉलम'PDOM'में missing वैल्यूज़ की गिनती निकालिए।- एग्रीगेट फंक्शन
mean()का उपयोग करके'PDOM'का mean वैल्यू निकालिए। fillna()का उपयोग करें, वैल्यू को'PDOM'के mean पर सेट करें, और केवल कॉलम'PDOM'पर लागू करने के लिएsubsetपैरामीटर का उपयोग करें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])