Follow the money
इस अभ्यास में, आप banking DataFrame के एक और वर्शन के साथ काम कर रहे हैं, जिसमें cust_id और acct_amount दोनों कॉलम में missing values हैं.
आप यह विश्लेषण निकालना चाहते हैं कि बैंक के पास कितने यूनिक ग्राहक हैं, ग्राहकों के पास औसतन कितनी राशि है, आदि. आपको पता है कि जिन पंक्तियों में cust_id missing है, वे आपके काम नहीं आतीं, और औसतन acct_amount आमतौर पर inv_amount की राशि का 5 गुना होता है.
इस अभ्यास में, आप cust_id missing होने वाली banking की पंक्तियाँ हटाएँगे, और डोमेन नॉलेज के आधार पर acct_amount के missing values को इम्प्यूट करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा क्लीनिंग
अभ्यास निर्देश
bankingमेंcust_idकॉलम के missing values हटाने के लिए.dropna()का उपयोग करें और परिणामbanking_fullidमें रखें.banking_fullidके लिए अनुमानित अकाउंट अमाउंट निकालने हेतुinv_amount * 5के बराबर सेट करें, और परिणामacct_impको असाइन करें..fillna()का उपयोग करकेbanking_fullidमेंacct_amountके missing values को नए बनाए गएacct_impसे इम्प्यूट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Drop missing values of cust_id
banking_fullid = banking.____(subset = ['____'])
# Compute estimated acct_amount
acct_imp = ____
# Impute missing acct_amount with corresponding acct_imp
banking_imputed = banking_fullid.____({'____':____})
# Print number of missing values
print(banking_imputed.isna().sum())